{"as_of":"2026-08-10T02:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87ab9f3e322eb7f1624cc4532b3f9d6837a085baf379f00fa6c898a9f0c6642b","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:58:08.643991Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00928/citation-record","integrity":"/paper/2506.00928/integrity","json":"/paper/2506.00928/citation-record.json","paper":"/paper/2506.00928"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T11:58:08.065790Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.065790Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:8b13017aaaa6dc3c4db97ecb910c8771d08e1bdcc92e7bfcec5a38ce6c0576d3","observation_id":"661074a2-ba1d-4c2a-bb75-d26358803388","resolution":{"observed_at":"2026-08-07T11:58:08.065790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.745830Z","title":null,"venue":null,"work_id":"9d080487-487f-4824-ad1e-74ddd1cc922a","year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.079290Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:22559a4536fbda96b668cf2118fcf13c57329b626863d33d47178b6ef042a04c","observation_id":"6fbbaa43-276b-4ea5-8110-f20991041e7c","resolution":{"observed_at":"2026-08-07T11:58:10.753863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T11:58:08.090193Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.090193Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:5bd48e260688a8f212c75ec4c6b6482cf43f27e2497d9ed783326efa90b5cc02","observation_id":"f205f64e-d814-4608-b617-3f2535bf5cc7","resolution":{"observed_at":"2026-08-07T11:58:08.090193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.702602Z","title":null,"venue":null,"work_id":"89e09fbb-20e5-42f1-902a-421b4112b7e2","year":1984},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.100925Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:eb581a1c7d8ed02d933a6fb503d88aa41314343a1c666e7d854ebf9624f96a7c","observation_id":"8149cf40-87c9-4658-8393-38ccfb40a981","resolution":{"observed_at":"2026-08-07T11:58:10.712770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T11:58:08.107125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.107125Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:86c8ac199e81b7ab8ccebeb5abf27c6721906b10a8bbc29f489e5a5798815b12","observation_id":"1f05cdf1-6cb3-4bc6-b8dc-6e29a695e0b9","resolution":{"observed_at":"2026-08-07T11:58:08.107125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3765/elm.1.4880","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.755439Z","title":"Bosch, Mathilde Chailleux, and Francesca Foppolo","venue":null,"work_id":"bb857b87-7c7d-42ab-b694-4f4ab08a3a29","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.113594Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:fab988d38386e75ce2db334e27c3f0ef03133fefd14d20b6190780b625b1977b","observation_id":"190c08d5-ef08-4c04-bad2-3aaafccb369c","resolution":{"observed_at":"2026-08-07T11:58:08.773160Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T11:58:08.121411Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.121411Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:67d41b073ac6c750cfebd96883bb7cdf3a3de7b12ca38f0b8c2aaa2e080d9511","observation_id":"305f6973-6c73-49c7-a805-d19b14918540","resolution":{"observed_at":"2026-08-07T11:58:08.121411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.672889Z","title":null,"venue":null,"work_id":"ebf1b448-317c-4e84-bcaf-749f97ebbc8a","year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.137586Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:eeb141a9a3fec2b4f67d376d080706c45fc9f6def6824defb277331132ea39a7","observation_id":"5174ea98-94dd-4396-b95f-d4ecb38eeee4","resolution":{"observed_at":"2026-08-07T11:58:10.684219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.148172Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.148172Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:7356009f1480f5f69e156eb4c9de699e24d8ddd1ca8b5e205d6b99ca5ac2439f","observation_id":"45f4a0c7-581e-43c9-9e16-0f09708d677b","resolution":{"observed_at":"2026-08-07T11:58:08.148172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T11:58:08.163052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.163052Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:13e0ebb71d25ab976b99f72e056abbffa4affff5c9fd280af5a50b3516944f50","observation_id":"7af4940d-214d-4cf0-b8e1-93b564dfb6be","resolution":{"observed_at":"2026-08-07T11:58:08.163052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.169555Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.169555Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:9ffbde5a74f4674b7cbe7866fc70076ef44e91e34c6267ac60a0dfbd0e7b942c","observation_id":"780dd187-28cd-426c-b1c3-4b8d4be3d655","resolution":{"observed_at":"2026-08-07T11:58:08.169555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-07T11:58:08.177631Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.177631Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:d4cf99b62d5313941aa7af9d069bf7445435111e142cbfcc34cee167b61db138","observation_id":"b3ea757f-cda6-4708-969b-56f7866b53d9","resolution":{"observed_at":"2026-08-07T11:58:08.177631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.605744Z","title":null,"venue":null,"work_id":"0c507f88-e7a1-4b78-a22c-6509d4843fc0","year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.185701Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:eb610fbc2122d1164a84a5e1395608ad4202135099d67c435ec26ec9de380df4","observation_id":"abe87411-74c7-4815-b49a-6688ee090634","resolution":{"observed_at":"2026-08-07T11:58:10.613626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.580701Z","title":null,"venue":null,"work_id":"c6ce1e5e-c2f7-4b36-af56-d4b4a2b3235a","year":2020},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.194140Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:95f24594c1f6b169395cefdbab3da398fd0608facbc9a86eb28ea44d9e88bac6","observation_id":"ea391800-8fe8-4cec-ac86-e26b7f1da069","resolution":{"observed_at":"2026-08-07T11:58:10.589722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.541896Z","title":"Bosch, Ciro Greco, Maria Nella Carminati, and Francesca Panzeri","venue":null,"work_id":"8625a964-f325-4ee2-901c-d51bf87fa54e","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.205597Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:d44c436d5eb71303741bd248b69dc56f198c9527a60291d1129e303c6ff0fc40","observation_id":"a67c9357-e855-4797-a47e-c00cf4454665","resolution":{"observed_at":"2026-08-07T11:58:10.548424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.505288Z","title":null,"venue":null,"work_id":"a25c98d6-7ab5-4f96-8697-8b6eb287d52d","year":2016},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.222972Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:d73f4b8deeddfca22ec4875a78ca903ac114ae9182d87f3a45970abfc4e65d42","observation_id":"3123e7e9-6174-4333-8504-59bf6df14862","resolution":{"observed_at":"2026-08-07T11:58:10.511873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T11:58:08.229550Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.229550Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:21c3169406b0c9b1f505a1e6539581bc59370789d22706538d58c1b3b9139c0b","observation_id":"88f3d769-d1dd-4af2-870a-aa6bc7679af3","resolution":{"observed_at":"2026-08-07T11:58:08.229550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.243662Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.243662Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:e83ec3a1e4ab0bd6b02385596db57749a970d1d1002351b502d2722c9f006e6f","observation_id":"33d5291c-fc49-4bb6-ac6b-ff35595f70e3","resolution":{"observed_at":"2026-08-07T11:58:08.243662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.444761Z","title":"Jang, Yale Song, Chris Dongjoo Kim, Youngjae Yu, Youngjin Kim, and Gunhee Kim","venue":null,"work_id":"8e87b7f4-c301-410c-9fd5-275b6d4af48e","year":2019},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.251953Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:25b7b2d5bc874713d4b10a1b4eef30a4f17f10a5eb62234364554593d16631fd","observation_id":"88dececd-f3ee-419b-8eab-d98ae24b3419","resolution":{"observed_at":"2026-08-07T11:58:10.452676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.402631Z","title":null,"venue":null,"work_id":"71fce54d-b557-4981-995a-f3e41eb68536","year":2019},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.261181Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:bd8d70e867a7e9d38ee9b6ae22122c5f546c3e029a691e26a3a3f64589d17ffe","observation_id":"101a6953-0694-4eef-9cb4-f98d0e2002ab","resolution":{"observed_at":"2026-08-07T11:58:10.409327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T11:58:08.269901Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.269901Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:1c53b4881e82f320c49daadfd3bca35a542f8f0e970e0c5b3cbae94b83e7406a","observation_id":"7a86d6d0-763f-4431-9bb2-a47548082387","resolution":{"observed_at":"2026-08-07T11:58:08.269901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.373098Z","title":"Richard Landis and Gary G","venue":null,"work_id":"2c194f2e-3806-46db-8366-e93e5a48071c","year":1977},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.279360Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:70122afe0de72fcc919fa24e2c9d865ba2ed53a2a8b4fda31a278c22f7372133","observation_id":"8ab32041-ba94-48b4-9e0e-184aec77ae79","resolution":{"observed_at":"2026-08-07T11:58:10.379407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.349205Z","title":null,"venue":null,"work_id":"1486567a-0ada-493d-a6b6-07adad978872","year":2018},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.294485Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:6e10fcf84719d44160f5044f50497556e4bc87b82187f4ec8897c9f03cdcf03f","observation_id":"6ba89717-7e6b-444d-8765-2e136566d15a","resolution":{"observed_at":"2026-08-07T11:58:10.355305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.317645Z","title":null,"venue":null,"work_id":"72e64724-0083-4d71-b325-5f2f5e6891e9","year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.304150Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:672f65584b236bf7310ae587027911607acaa98557cb6a669f9acc9c4bf1ef4e","observation_id":"8d77b7a2-50c7-406a-9503-d99203cf17a7","resolution":{"observed_at":"2026-08-07T11:58:10.328245Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.293011Z","title":null,"venue":null,"work_id":"361c6f53-e82b-4e0d-8e0e-890a1eeda5be","year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.309019Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:33862fe51b3413dff6e8c7f10e0b2479f89b3a880a2032917cb5b4f7f8e2e948","observation_id":"84b0703e-e012-4999-b0df-827ebc4bc01f","resolution":{"observed_at":"2026-08-07T11:58:10.299380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T11:58:08.318031Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.318031Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:01b1745c55ff52c8d3098b0358250d3ae08a4f943dffce5b4195205f067017f9","observation_id":"dbb4b5e4-3a7e-4e76-b17d-325ebe888241","resolution":{"observed_at":"2026-08-07T11:58:08.318031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.260787Z","title":null,"venue":null,"work_id":"1bbd2030-3f19-4ef0-8e6d-a4692a89b7bd","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.326369Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:b6d39727408124a0cc60456ce294a3612523b7a35165ae2d09a2355f0b1d64ef","observation_id":"003702f3-d3bb-4edb-aeea-0450b3168719","resolution":{"observed_at":"2026-08-07T11:58:10.270819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T11:58:08.340059Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.340059Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:7f14060f1557980d838ad7c4da9cd775509c1b9fc50df05de399e3278c58cc68","observation_id":"eda7a662-bae1-4f30-a5ad-1902a40b912d","resolution":{"observed_at":"2026-08-07T11:58:08.340059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14248","last_updated":"2025-05-30T17:01:57Z","snapshot_observed_at":"2026-07-06T19:35:48.603411Z","submitted_at":"2024-10-18T07:52:22Z","title":"Addressing Blind Guessing: Calibration of Selection Bias in Multiple-Choice Question Answering by Video Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14248","snapshot_observed_at":"2026-08-07T11:58:08.355931Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.355931Z"},"links":{"cited_paper":"/paper/2410.14248","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:b0a247d923bbcbc314897c33cc9dcedaa50c1d7943d00610dc6b32fbf242ca56","observation_id":"57753b8c-62ef-4678-b831-78e636faa163","resolution":{"observed_at":"2026-08-07T11:58:08.355931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02910","last_updated":"2023-07-06T10:52:22Z","snapshot_observed_at":"2026-07-06T15:51:00.588745Z","submitted_at":"2023-07-06T10:52:22Z","title":"Agentivit\\`a e telicit\\`a in GilBERTo: implicazioni cognitive","version":1},"cited_work":{"arxiv_id":"2307.02910","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.02910","snapshot_observed_at":"2026-08-07T11:58:09.246182Z","title":"Agentivit\\`a e telicit\\`a in GilBERTo: implicazioni cognitive","venue":"cs.CL","work_id":"d2c37e33-ce03-4417-9bbe-d964c8367f3d","year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.363088Z"},"links":{"cited_paper":"/paper/2307.02910","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:50264950b3e71e14c1e6ef3e87efa8e73c7ae7667cdc2188b805a47cc9147702","observation_id":"77c7fac6-a0ae-4e54-812f-90d8282ef350","resolution":{"observed_at":"2026-08-07T11:58:09.253700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T11:58:08.371169Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.371169Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:a10f5b437540c83f1cbbdec2e7d3438006048bf540ab38e476e88c42604c7ff8","observation_id":"df6d49b8-2b3a-4ee0-aa00-408b69daaa68","resolution":{"observed_at":"2026-08-07T11:58:08.371169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.cmcl-1.10","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.724694Z","title":null,"venue":null,"work_id":"81bc41af-8554-49a8-9212-2f99fad413e8","year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.380118Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:ba60f638813383e3d3b86a9681d811bbdfa4923488a0a3fff2eb284cf08141b9","observation_id":"7f14d5e1-ef21-48b7-91bb-e9ded914a0e7","resolution":{"observed_at":"2026-08-07T11:58:08.730314Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.229101Z","title":null,"venue":null,"work_id":"ce6466ba-7a36-400a-8b99-5200dad40211","year":2019},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.391886Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:569e59734d6619f1da6981d9fb05f0fc5fcc19eea41251b6ecda01c4dc0d2714","observation_id":"65869796-290d-4a5f-ad21-318311b7bf4b","resolution":{"observed_at":"2026-08-07T11:58:10.240152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.189469Z","title":null,"venue":null,"work_id":"698c8a62-acf5-49d2-90e5-3650f5a34c35","year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.398684Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:8f3ed24b6ca081e625595edd7e773d1f38a3a5b4abfc3f7cfc8eb7ae46300699","observation_id":"d6e8a864-4a98-46ec-9279-f20853c0ec43","resolution":{"observed_at":"2026-08-07T11:58:10.203402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.154880Z","title":null,"venue":null,"work_id":"a907b700-8da9-4810-afe1-2246cae08881","year":1988},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.405770Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:f42fba690e09a18a533a5563585107819d84fdf1a12a4cc22aa484dad0dc1325","observation_id":"357174b5-9dd7-47cb-931d-64eadb196113","resolution":{"observed_at":"2026-08-07T11:58:10.163004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.414163Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.414163Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:d079084668c737390d83e8ca737303663540c47a4609ff6f18ce887a4884967a","observation_id":"5814384c-e745-4a4d-ae37-4a4db5be6698","resolution":{"observed_at":"2026-08-07T11:58:08.414163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.420869Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.420869Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:57027c069e15b523f60bd4553cf4671bcb70138b20a2592ac4a4078f58c5b2ae","observation_id":"97b4ab7a-f919-43e0-b666-cb0904b0fbda","resolution":{"observed_at":"2026-08-07T11:58:08.420869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.047151Z","title":null,"venue":null,"work_id":"9a53718b-f5b5-44b4-b27d-cf10999cd897","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.427772Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:b43acc5c8d22cb6d6332be5db027f84ade49f5c8a78ff3b6a19fefc075cbea85","observation_id":"9911d2db-23b7-4b05-af9d-22fde91c33ed","resolution":{"observed_at":"2026-08-07T11:58:10.067753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.992110Z","title":"Anwer, Tim Baldwin, Michael Felsberg, and Fahad S","venue":null,"work_id":"fd9df57e-eb32-4f78-b189-5e5cb756183a","year":2025},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.437777Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:3d599f2e67e08daea373019ab7734aaa85c61446362b6e1de97b3c3966ac8185","observation_id":"8a725ab7-a015-451f-beec-04fa9aeb1814","resolution":{"observed_at":"2026-08-07T11:58:10.011609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03762","last_updated":"2021-04-08T13:27:43Z","snapshot_observed_at":"2026-07-06T10:57:37.935354Z","submitted_at":"2021-04-08T13:27:43Z","title":"Video Question Answering with Phrases via Semantic Roles","version":1},"cited_work":{"arxiv_id":"2104.03762","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.03762","snapshot_observed_at":"2026-08-07T11:58:09.179045Z","title":"Video Question Answering with Phrases via Semantic Roles","venue":"cs.CV","work_id":"0f8d6a1b-0b3e-4272-a6c9-aaabc5629e18","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.449747Z"},"links":{"cited_paper":"/paper/2104.03762","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:2b0e587acf3f0032f8bca3dc806e338c7f6ad425433b3b3dfefa3c90b4c57ebc","observation_id":"3b6ff0a6-05be-4876-a83e-04b6bbee94d9","resolution":{"observed_at":"2026-08-07T11:58:09.185982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.962436Z","title":"Sigurdsson, G \\\"u l Varol, X","venue":null,"work_id":"60fb2ad1-72bf-421d-8c6a-03e33fdf76ef","year":2016},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.463803Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:b7f8f3b4ad3701372bc5b5e443d0d99c7b79c84528b3c00b82ef369dab7850ec","observation_id":"7b4c77ae-1998-49f9-96b9-b7dfba8e7405","resolution":{"observed_at":"2026-08-07T11:58:09.970795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:58:08.473338Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.473338Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:348b8d39f2adb91ef1670831bfac8c279995467dd7280f9c8d4bdb5283b1d4a4","observation_id":"47f487db-cb26-4286-83b1-8ad8e5541a67","resolution":{"observed_at":"2026-08-07T11:58:08.473338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.934928Z","title":null,"venue":null,"work_id":"df601b26-594f-49b7-ab86-2745663b4477","year":1994},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.484690Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:c6977cfb8706e0f62e40ccea63f60c13c9709e287e49a6cc4b1092386e648e3f","observation_id":"99e957c6-d17e-40dd-832f-b4d4bd4c4be1","resolution":{"observed_at":"2026-08-07T11:58:09.940208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T11:58:08.490321Z","title":"Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, Daniel M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.490321Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:d245b703324543d0b0482f2bb8943dfeb066f960f0cfbf2d65e3e48032ef6aae","observation_id":"6f28e24c-fd11-4442-b9a1-5dc98113b0fe","resolution":{"observed_at":"2026-08-07T11:58:08.490321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.897351Z","title":null,"venue":null,"work_id":"8aebdcac-fb20-4e3e-b305-3378f3f8d33d","year":2008},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.498573Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:d19d0794187043a5178c2f49d44a52e6d18fb2aa53d957ccfccaab98837e7a88","observation_id":"f9412774-1016-4c9d-ae3d-b17c4d922938","resolution":{"observed_at":"2026-08-07T11:58:09.907561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.867283Z","title":"Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":"cbfa9d46-29e1-463d-9812-37538fec7069","year":2017},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.509837Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:a038994cb1d0587efa9bfcca2f7a1903eed15f5cef16f968edc04154a80486b4","observation_id":"142db803-8e86-4a28-bcc5-e8239baec08e","resolution":{"observed_at":"2026-08-07T11:58:09.879043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T11:58:08.520364Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.520364Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:14b6e3756febec83d5e8771ca48b5604b474e0407531fa6f26918ca6613c166b","observation_id":"71817efc-3217-43ed-ad6e-3f631e95fc82","resolution":{"observed_at":"2026-08-07T11:58:08.520364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.838364Z","title":null,"venue":null,"work_id":"aafc8118-f49f-4c86-9f46-62ca08a8769e","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.531169Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:3f2d49d039e5fc3905cf176f250259122e474e0948e0954db6829ba8fcc6d4f9","observation_id":"3a903595-c68d-4c9e-9d41-4151345d5212","resolution":{"observed_at":"2026-08-07T11:58:09.844726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05040","last_updated":"2025-06-30T07:41:07Z","snapshot_observed_at":"2026-08-07T16:07:58.938906Z","submitted_at":"2025-04-07T13:05:09Z","title":"InstructionBench: An Instructional Video Understanding Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05040","snapshot_observed_at":"2026-08-07T11:58:08.540817Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.540817Z"},"links":{"cited_paper":"/paper/2504.05040","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:da7d3b723e8a6342f9489ef1f13a3d4bdf648ca8a7c63d668a6cab15a8360635","observation_id":"7de2259f-8e1f-466d-8cfb-4bea5307059a","resolution":{"observed_at":"2026-08-07T11:58:08.540817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.804484Z","title":null,"venue":null,"work_id":"38a710fc-0c09-4261-9187-2702d32f9f1d","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.551390Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:777984f36aeb11ef08476d963ded7f606ada69491d7436a9c2de5500324480fc","observation_id":"73c04c96-407e-490a-a3fd-f5f0974c377e","resolution":{"observed_at":"2026-08-07T11:58:09.813619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.559129Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.559129Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:22da3a6280d2d238c15babbc8fe2f47d291a8094a1241c53dc7ed30a75cf1c05","observation_id":"f87a7a24-3391-4e34-ad8c-22d14662f196","resolution":{"observed_at":"2026-08-07T11:58:08.559129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.572193Z","title":"Xu, Zhou Zhao, Jun Xiao, Fei Wu, Hanwang Zhang, Xiangnan He, and Yueting Zhuang","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.572193Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:5be884ddfdfb7669b44fc4e76d6cb3c7a49c55b1d8cb7249e8fe63fca64f8618","observation_id":"dfd73e6f-180f-468e-9b48-2121b184fcd2","resolution":{"observed_at":"2026-08-07T11:58:08.572193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T11:58:08.580265Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.580265Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:1a41050d576b2659dc0dae9c207d2a531febda01c7a9844f569eda08dc9ddda1","observation_id":"583eb29f-cf09-4dcb-a04d-1b18f0d70251","resolution":{"observed_at":"2026-08-07T11:58:08.580265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02467","last_updated":"2019-06-06T08:08:14Z","snapshot_observed_at":"2026-07-06T07:58:24.206559Z","submitted_at":"2019-06-06T08:08:14Z","title":"ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02467","snapshot_observed_at":"2026-08-07T11:58:08.586217Z","title":"Xu, Jun Yu, Ting Yu, Zhou Zhao, Yueting Zhuang, and Dacheng Tao","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.586217Z"},"links":{"cited_paper":"/paper/1906.02467","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:6da2d4307c048d9930d26ab99327e3ba009fe8791fe76571d59445e2850aff54","observation_id":"0f910687-a0df-43de-a1f3-02378c2032ba","resolution":{"observed_at":"2026-08-07T11:58:08.586217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16153","last_updated":"2025-01-26T15:34:59Z","snapshot_observed_at":"2026-07-06T19:37:11.636987Z","submitted_at":"2024-10-21T16:19:41Z","title":"Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16153","snapshot_observed_at":"2026-08-07T11:58:08.593276Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.593276Z"},"links":{"cited_paper":"/paper/2410.16153","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:63e06e97aafc3751115f4e2432b3da1f472949359b549991ef2498f3e07f4aac","observation_id":"4a733a98-b3dc-49d6-b2e2-f4ad12fd0db0","resolution":{"observed_at":"2026-08-07T11:58:08.593276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-07T11:58:08.598707Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.598707Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:78a8384d5e1175f37f34c714bbc871431dddddc40bb1f88a36a85e8c0ba8f48d","observation_id":"a858a6da-6e70-4864-8619-3aaf6e95981d","resolution":{"observed_at":"2026-08-07T11:58:08.598707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T11:58:08.604138Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.604138Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:fc0ca199ecc9df9ee8fc338d169d337db0f1a9575f9898e32e102355ecdf6b6b","observation_id":"5762f209-5a99-4b11-9c1c-55cd14564bbe","resolution":{"observed_at":"2026-08-07T11:58:08.604138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.conll-1.6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.694266Z","title":null,"venue":null,"work_id":"cf1307cd-f2ed-48fb-bcb0-e42a62110b98","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.611110Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:4881893a0e536aa8769310e877b82dffc864a6ac04dd67a30300ee8684ae2a48","observation_id":"41957909-cf19-4920-ac01-d848ae17fb67","resolution":{"observed_at":"2026-08-07T11:58:08.704124Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01225","last_updated":"2022-11-02T05:25:06Z","snapshot_observed_at":"2026-07-30T11:11:52.165985Z","submitted_at":"2022-03-02T16:34:09Z","title":"Video Question Answering: Datasets, Algorithms and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01225","snapshot_observed_at":"2026-08-07T11:58:08.626602Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.626602Z"},"links":{"cited_paper":"/paper/2203.01225","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:a88f789724c8294e11262040fa2c84980bbbbae2d00c06732cd0b2530127a304","observation_id":"8896bb95-5376-4b02-a7d7-7c0f7a5e5aa9","resolution":{"observed_at":"2026-08-07T11:58:08.626602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.634847Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.634847Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:38a5db46dab2dde1caa006129ef79b103ddf0f3daa81ae12c28b1e40c32fa2df","observation_id":"f4ff0b5f-be66-46ea-94b5-cd49718bdd99","resolution":{"observed_at":"2026-08-07T11:58:08.634847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.643991Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.643991Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:dd6c9eeb3a101b3f28579e63fe9fee36d9bd54362a940ba258e9b5ad924169e5","observation_id":"7ee018d2-2192-4ea8-be87-1c20cc788438","resolution":{"observed_at":"2026-08-07T11:58:08.643991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":5,"verified_fuzzy":6},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2506.00928."}