{"as_of":"2026-08-08T04:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:36b062788137e7a966d8decf63e22676cfd1fecb2d17a81513970ff662c3c664","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:24:55.008240Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06361/citation-record","integrity":"/paper/2608.06361/integrity","json":"/paper/2608.06361/citation-record.json","paper":"/paper/2608.06361"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23673","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:55.991517Z","title":"L.; Panda, S.; Meghwani, H.; Singh, J.; Dua, K.; Li, P.; Sheng, T.; Ravi, S.; and Roth, D","venue":null,"work_id":"7d1c0d58-dc3c-4cf2-99f6-c35b01a77dd5","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.144137Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:eba8fc1e9dc7ac7bc1bcda9e8f484a2d0575859dcbd92770d2a862bb56d8e96e","observation_id":"d7c84f27-de22-4830-958c-c31c17eba640","resolution":{"observed_at":"2026-08-07T04:24:56.000894Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-07T04:24:52.231517Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.231517Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:452efcbf7fc2c93bfa1551a9b4c260a1c97e0c070dcb00261e93f9a0c6a90acd","observation_id":"07944c51-e15a-4a6c-a568-eb97ff54b32d","resolution":{"observed_at":"2026-08-07T04:24:52.231517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05523","last_updated":"2025-06-05T19:12:45Z","snapshot_observed_at":"2026-08-07T22:11:58.027730Z","submitted_at":"2025-06-05T19:12:45Z","title":"MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05523","snapshot_observed_at":"2026-08-07T04:24:52.386597Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.386597Z"},"links":{"cited_paper":"/paper/2506.05523","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:6a3e255bd2625b2539b738d8ba16768e408c49a0cdea704741bc3a9b0b260a89","observation_id":"8c0f946c-1274-42ff-8e08-c1fa16448b78","resolution":{"observed_at":"2026-08-07T04:24:52.386597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.685730Z","title":"M.; Kota, T.; He, J.; Eyzaguirre, C.; Durante, Z.; Li, M.; Wu, J.; and Fei-Fei, L","venue":null,"work_id":"b7b00303-fa0f-4f09-b50e-54270d4fc472","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.488003Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:b7a64db1ec36f694626f2e0da59a0c244f187053687d6bf2ddb711b970d0226b","observation_id":"599d86f9-2b43-4dd5-94d9-a12d01fc3ef8","resolution":{"observed_at":"2026-08-07T04:24:56.691178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T04:24:52.643870Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.643870Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:f0ea29b56ffaa482154a4d2f948038aa78cd56cda60d472f6d5d30c49292dd24","observation_id":"671a9d24-71dd-4040-a285-22661e74e1c7","resolution":{"observed_at":"2026-08-07T04:24:52.643870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.667794Z","title":"P.; Li, W.; and Gong, S","venue":null,"work_id":"dfbfba22-a0f0-4818-8b12-375808d8371d","year":2026},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.734869Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:3e11c115e60ee85e70cca0b42cc8ccc6d8c4964e9a28ba9226cea0ca8fecf089","observation_id":"0805b9db-5acd-4cf9-8d63-735f9a1322c1","resolution":{"observed_at":"2026-08-07T04:24:56.672317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.651591Z","title":null,"venue":null,"work_id":"cd80b78e-8e60-4a64-82d7-f439356d9422","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.830178Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:ab9d3f81b931b93f18b4ff4bbe96a041136a909ebe253215b90cab4ac05520b6","observation_id":"07139ee8-aa73-416a-984a-5340b765adc4","resolution":{"observed_at":"2026-08-07T04:24:56.655945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.10611","snapshot_observed_at":"2026-08-07T04:24:52.914333Z","title":"S.; Salehi, M.; Tripathi, R.; Lee, S.; Ren, Z.; Kim, C","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.914333Z"},"links":{"cited_paper":"/paper/2601.10611","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:1434f83c680bb2a6b72f02675aecde837651091796ad59ee14443e2149eec8f8","observation_id":"cfcddce4-ae72-4b94-b290-f290aef5a431","resolution":{"observed_at":"2026-08-07T04:24:52.914333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.634624Z","title":null,"venue":null,"work_id":"41a17906-5ad2-4d33-bdcb-fd201beac256","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.012924Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:e6073bae62fb7718d108ebb1df0924edc6fa4798af871c3a10a3cea6304cb9e2","observation_id":"823347c9-3cd6-4b20-86b5-a49d03ba5008","resolution":{"observed_at":"2026-08-07T04:24:56.639322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.614834Z","title":null,"venue":null,"work_id":"9ea698a5-aca6-4473-8d9b-8ebbdd887b9d","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.214323Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:39160a65ddab7e892fbaae89503cb8238ac9a38b6b9eb7f1c2af55c571434035","observation_id":"92ed64fa-c936-432c-a326-d779fce80713","resolution":{"observed_at":"2026-08-07T04:24:56.620228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T04:24:53.296769Z","title":"A.; Ma, W.-C.; and Krishna, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.296769Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:b1a9a3d4175ad24b81725b303d3888f68db10d635c7d663a292358f95ec1e21e","observation_id":"2f4fecf4-dedb-4797-aab3-cfc5ecd2ec38","resolution":{"observed_at":"2026-08-07T04:24:53.296769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.595407Z","title":"W.; Li, L.; Yang, Z.; Wang, L.; and Cheng, Y","venue":null,"work_id":"0d3b691a-76ae-4b19-bb7f-2bc92164c3c6","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.418701Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:a8148b1116b362495b29b4b7d34b478fd47ac354d1cb3ba5d992ae4d0dc3195b","observation_id":"30ee07bf-454e-4f99-823a-6742c436921c","resolution":{"observed_at":"2026-08-07T04:24:56.602422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.572948Z","title":"L.; and Girshick, R","venue":null,"work_id":"3dff3ca5-439e-477b-bdea-05eb0aa8267d","year":2017},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.726452Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:9dbd6eb91b5deadf16fb5f6eae6bd5ec2f7b9aba1a20e72cd25e5755b90baaa6","observation_id":"5a226575-a1be-4601-b9d0-1b1f8ab7ca45","resolution":{"observed_at":"2026-08-07T04:24:56.578561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09105","last_updated":"2025-07-01T03:47:15Z","snapshot_observed_at":"2026-07-06T19:50:05.918060Z","submitted_at":"2024-11-14T00:26:26Z","title":"VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09105","snapshot_observed_at":"2026-08-07T04:24:53.867176Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.867176Z"},"links":{"cited_paper":"/paper/2411.09105","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:5c1e34b663cddbc2efcb4fbdcc303c3b40767e765b0a456706e406b962db2574","observation_id":"81537453-421d-4dd5-add1-b1ca663a9126","resolution":{"observed_at":"2026-08-07T04:24:53.867176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-07T04:24:54.025621Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.025621Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:decc84268f491f4b9c3cd908cd75b23f38c3c69cf3dd04880bb9b13e47ff13be","observation_id":"d91c9d61-57eb-42aa-9c96-71709166d49e","resolution":{"observed_at":"2026-08-07T04:24:54.025621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.553503Z","title":null,"venue":null,"work_id":"8bbc0411-d052-4385-8dda-756358f7e01c","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.245785Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:0e46e299ffbf3c73943c80b6d1413dc4435f756ce462d5c23739a9277cf6e48a","observation_id":"7677c8b8-5d86-44cb-9938-e5aa4cda0546","resolution":{"observed_at":"2026-08-07T04:24:56.559694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.535366Z","title":null,"venue":null,"work_id":"64bc7dc9-056a-4705-abb4-59a83fbef628","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.384918Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:f40cb243075f6c62ea951c88a88900d0051b4633b113bce831b305cb2ebb0735","observation_id":"5d1fd752-2a2d-4fd6-905c-cd9935f0481b","resolution":{"observed_at":"2026-08-07T04:24:56.540311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T04:24:54.511970Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.511970Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:4d927efd1857f86c013f93f4ce805720b754658a9d8b89f8c1b2d36793265ca2","observation_id":"6ebfd26c-e9d8-4278-9bdb-640d56553c47","resolution":{"observed_at":"2026-08-07T04:24:54.511970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.519201Z","title":null,"venue":null,"work_id":"0f792ec3-ed9e-4f64-98fc-d4c7d8f5aee0","year":2023},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.664409Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:72c5e2198fe658abc42acfebdbc9ade511d378b75e70eecf6e28cc7acee39ba0","observation_id":"17e824f4-ed54-4ee8-8f78-5cd733c5cd47","resolution":{"observed_at":"2026-08-07T04:24:56.524376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06941","last_updated":"2025-11-20T00:19:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-07T22:42:29Z","title":"The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06941","snapshot_observed_at":"2026-08-07T04:24:54.749022Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.749022Z"},"links":{"cited_paper":"/paper/2506.06941","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:ff12500ded3ea5fde2e1da255607b746dc35a0a48052a3595aa40f83d84e116d","observation_id":"db54f330-9e3e-4d4c-ac75-3c597c212482","resolution":{"observed_at":"2026-08-07T04:24:54.749022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14693","last_updated":"2025-05-02T22:30:26Z","snapshot_observed_at":"2026-08-07T16:00:45.565705Z","submitted_at":"2025-04-20T17:58:46Z","title":"Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14693","snapshot_observed_at":"2026-08-07T04:24:54.755039Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.755039Z"},"links":{"cited_paper":"/paper/2504.14693","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:a3a4b1be2ef92886d71b0bbe7d2d0619c24b81a4d130d7ca1175dfb287e2d403","observation_id":"62aba644-7176-4f22-b1ed-11b45250e50a","resolution":{"observed_at":"2026-08-07T04:24:54.755039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18880","last_updated":"2025-06-23T17:51:40Z","snapshot_observed_at":"2026-08-06T23:12:46.021492Z","submitted_at":"2025-06-23T17:51:40Z","title":"OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18880","snapshot_observed_at":"2026-08-07T04:24:54.759751Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.759751Z"},"links":{"cited_paper":"/paper/2506.18880","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:a07add80cb9a6eea423f34cfa417afd6d7bd412a988f7124a159fa846110f89e","observation_id":"bb9418fb-fd26-484e-91b6-02a8fea9c261","resolution":{"observed_at":"2026-08-07T04:24:54.759751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.764865Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.764865Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:ef62a3276e24e894c1084f60d6d601bd0e7ba27b6bab0f7d73177eaf0ca32861","observation_id":"bf8a1780-e20e-43be-a311-3ad12ba35cb3","resolution":{"observed_at":"2026-08-07T04:24:54.764865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06209","last_updated":"2024-04-25T07:12:39Z","snapshot_observed_at":"2026-07-06T17:14:32.455890Z","submitted_at":"2024-01-11T18:58:36Z","title":"Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06209","snapshot_observed_at":"2026-08-07T04:24:54.770078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.770078Z"},"links":{"cited_paper":"/paper/2401.06209","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:9ba2ffb4c6fa9442e403497fd93c8b6999bb593925f3bdfe05884823293d9bb1","observation_id":"8e51ee67-2932-4e6c-a1ff-4b3e0843eb3e","resolution":{"observed_at":"2026-08-07T04:24:54.770078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-07T04:24:54.777262Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.777262Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:f0c51e82ceb539e37db4842a191757a2709f5907b2192913dc1319f9ff1d8f6f","observation_id":"37f66cc9-eb61-476a-bf83-4e07eab41068","resolution":{"observed_at":"2026-08-07T04:24:54.777262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.500705Z","title":null,"venue":null,"work_id":"eabe7992-d278-4bfe-a841-2cdf8a466eea","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.788332Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:ca2ae900f58ee8062d63a725cff85ea689cdcc6f03210c97b25d86cb618e58f5","observation_id":"9a10bc43-c406-4344-ad18-d58920138353","resolution":{"observed_at":"2026-08-07T04:24:56.505970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-07T04:24:54.793516Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.793516Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:56913ec08557d9c61fd98016ae8991304bf18fa031b5cc844029a737326593ab","observation_id":"abc2a3de-42ec-41a4-9a5c-bffa94bcc04d","resolution":{"observed_at":"2026-08-07T04:24:54.793516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.799125Z","title":"J.; Huang, Y.; Liu, Z.; Qu, P.; He, J.; Chen, J.; Yuan, Y.-J.; Han, J.; Xu, H.; Li, H.; Sachan, M.; and Liang, X","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.799125Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:9961fb901d8ad93e8c8ecbd53a834c2b6ef98bc4222708218c610a8bc6cbe4ab","observation_id":"cb2382fa-fb81-4374-8239-61807de95740","resolution":{"observed_at":"2026-08-07T04:24:54.799125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-07T04:24:54.809548Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.809548Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:9443e341ea8fd4d9b067d2d089abf47446fe1bfd42f8dc74fc58481a50010c79","observation_id":"19cbbeb2-51d4-4e30-8d45-ca82d8efd493","resolution":{"observed_at":"2026-08-07T04:24:54.809548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.815382Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.815382Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:c1ef5e66d719634d7311a9fec8f5368afee3ed7d96bc0c9665f70af00cef3c56","observation_id":"5f0f0fda-46cf-4be4-b234-0ebd0af11645","resolution":{"observed_at":"2026-08-07T04:24:54.815382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.468267Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":"2c8bd4e3-8394-4522-a02e-37dfcfefc2bb","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.821197Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:ebb492a1e2f58e51bbc025241224239b83f26d2ed93075046ebf2dfe3b0975f5","observation_id":"5a27b7c3-fa34-427b-bced-52db97aefa1a","resolution":{"observed_at":"2026-08-07T04:24:56.474953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.448642Z","title":"T emp C ompass: Do Video LLM s Really Understand Videos?","venue":null,"work_id":"c64bf8fe-363e-4903-bcbd-d805a3c2fce5","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.826419Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:af04bfc5fb2752031e5e317182bd839331940004cf5452df407fa06c927ea678","observation_id":"1b8f7891-dae9-4ca9-8a64-7008f05e4b0a","resolution":{"observed_at":"2026-08-07T04:24:56.453882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.430733Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , pages =","venue":null,"work_id":"47e1983d-26fc-4c59-b611-62f77e623e24","year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.831264Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:a0ccc60ddc3c5353877a68ab6367bb28a982ba0cbdf9c48aa4b994eaebcd4197","observation_id":"fd09c947-e957-4f7e-a9c0-a0ae21b9e44c","resolution":{"observed_at":"2026-08-07T04:24:56.435710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.413564Z","title":"and Kota, Taran and He, Jimming and Eyzaguirre, Cristobal and Durante, Zane and Li, Manling and Wu, Jiajun and Fei-Fei, Li , booktitle =","venue":null,"work_id":"3ec911c5-0aa1-40b0-aa1a-6cef691dd415","year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.836116Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:d249742007a8668f37faaeeb10f9cdca5f33d343077aff9f8c92e406f62c191d","observation_id":"7f2dcae5-0272-4da8-9aad-5be1c79680d3","resolution":{"observed_at":"2026-08-07T04:24:56.418861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/075280-2004","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:55.061120Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding , volume =","venue":null,"work_id":"5da15062-56aa-4aa6-ae92-42190d53b69c","year":2004},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.842447Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:40ca60ac9b558bc93ecbe979c1e52a008dce2ceaf4bce65e12baea0af4a984a3","observation_id":"c3b7d9a1-f192-4f65-9048-b2c86a063eeb","resolution":{"observed_at":"2026-08-07T04:24:55.067902Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.394696Z","title":"2024 , eprint=","venue":null,"work_id":"d1ea205a-4e0c-472f-8806-e8c2942bc1e8","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.848233Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:29387e3e5e0ff98d6b86895a4e648292a8074245df0c42acd7229ad2388c1e3a","observation_id":"8f5df2b8-86b4-45ec-be73-207a60f414fc","resolution":{"observed_at":"2026-08-07T04:24:56.401075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.376404Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":"414630e9-a435-46c8-affe-0c21119ceeed","year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.853320Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:c6c7371c8c10fa42fdad79caa479c14a370161f456e2d3664c29a3e6a7ddc815","observation_id":"ace52e79-d713-41aa-9ddc-050d36c33230","resolution":{"observed_at":"2026-08-07T04:24:56.381945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.359176Z","title":"2025 , eprint=","venue":null,"work_id":"63f267f8-6bab-43f4-a786-312a308bf492","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.858091Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:b70077d54a586e27bdc8444c410d8447f43a393d19f0968be133ab85b25666e5","observation_id":"15810289-8cee-4a45-9f3b-74ca14ececa6","resolution":{"observed_at":"2026-08-07T04:24:56.363864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-07T16:00:09.967849Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T04:24:54.863248Z","title":"arXiv preprint arXiv:2504.16074 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.863248Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:a99f5407163b706d6a1ac04b737581cdb0111296c73d381e69d611c61d1c378a","observation_id":"6db93d44-64d1-43b9-b14c-0093100b1754","resolution":{"observed_at":"2026-08-07T04:24:54.863248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.868214Z","title":"arXiv preprint arXiv:2512.05091 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.868214Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:e46748258a4870ca7b3203615c70dcb781b68c2768bf50007e80e806f1a5e626","observation_id":"4ccd3904-b946-4a70-a5d7-9cfbd058001f","resolution":{"observed_at":"2026-08-07T04:24:54.868214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.873262Z","title":"arXiv preprint arXiv:2505.23359 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.873262Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:93ec30ccb25f47ce58607c9a10a90c1e2e30b12590e0b363dc9ad58a7de0afd0","observation_id":"679bf50f-250d-406c-b904-95b71e93cf43","resolution":{"observed_at":"2026-08-07T04:24:54.873262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.341591Z","title":"2025 , eprint=","venue":null,"work_id":"89257845-42bc-47dd-b7fa-d05599f94dd9","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.878051Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:9b232cb08f9c6aed94da7177f7c310bad7b5fff926ea882e76867eaf6f7b4a7e","observation_id":"b2341d0e-c233-400c-8f1b-1e587130ecf7","resolution":{"observed_at":"2026-08-07T04:24:56.346770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.324881Z","title":"Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs , volume =","venue":null,"work_id":"b3734256-352b-401f-9eb2-6b6fcea0528d","year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.883261Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:d7dd7ea1653290ccfedc9057454521735be2bd0e078ef948ee01cb0b908e3bdf","observation_id":"fa2ed78d-82ba-4cda-bd07-c3d25ac51509","resolution":{"observed_at":"2026-08-07T04:24:56.330599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.304434Z","title":"2024 , eprint=","venue":null,"work_id":"e659adc0-f3c4-484e-9b7a-a35f6e1e85e2","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.887607Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:77e28f63f813eb58cafbdff09ac6bbbce69c835d797898565f64495e53d4db95","observation_id":"5788ee92-2d80-4450-8b1d-78067fbe5342","resolution":{"observed_at":"2026-08-07T04:24:56.310306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01018","last_updated":"2022-04-03T07:50:18Z","snapshot_observed_at":"2026-07-06T12:56:07.820484Z","submitted_at":"2022-04-03T07:50:18Z","title":"TransRAC: Encoding Multi-scale Temporal Correlation with Transformers for Repetitive Action Counting","version":1},"cited_work":{"arxiv_id":"2204.01018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.01018","snapshot_observed_at":"2026-08-07T04:24:55.788573Z","title":"TransRAC: Encoding Multi-scale Temporal Correlation with Transformers for Repetitive Action Counting","venue":"cs.CV","work_id":"c3117cc2-8dde-4ed2-a997-8cab5822f78d","year":2022},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.891710Z"},"links":{"cited_paper":"/paper/2204.01018","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:d86b1c4365b4af7967213036801076d358710c58bf2a4126b0a8a112c62b108d","observation_id":"aa320b76-db6a-4cf0-82d2-21f43de77622","resolution":{"observed_at":"2026-08-07T04:24:55.795302Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.895820Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.895820Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:3b5ef5348de6a175682fc19ab4c7c3bba383c153c9e232054d22b35122f55f8b","observation_id":"d5e61dbc-7926-43b7-8d8c-e253a4975770","resolution":{"observed_at":"2026-08-07T04:24:54.895820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.900531Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.900531Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:7009f642f40d35a2dc731e2d08d5adb321b0493b65aa841de848a3bab2280cfc","observation_id":"4dce49a0-883c-435e-8dcb-31d07b9cface","resolution":{"observed_at":"2026-08-07T04:24:54.900531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.904905Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.904905Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:c47e1e42707bf43580aa22b78d93ee976d22c4ad42cced81267b790607465a84","observation_id":"e964b1e2-40c0-4100-bca9-cc1c452ce07f","resolution":{"observed_at":"2026-08-07T04:24:54.904905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.909336Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.909336Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:a9d0c7c61bdb8830b5e413e15514da0c9b3c3c691addd53188fd63efbd85383c","observation_id":"5e58298e-02f4-4315-aaad-bb7d062ea2b8","resolution":{"observed_at":"2026-08-07T04:24:54.909336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.236214Z","title":"Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences","venue":null,"work_id":"bc732eb4-522a-4ea5-9a19-3a55438b1806","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.913877Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:08c6da2bf2d69987530b4f4f0353c7a066cd37b14ded39fc8637017a3cdc90bf","observation_id":"22ba40ce-b387-4a60-892b-8dcfff417bf8","resolution":{"observed_at":"2026-08-07T04:24:56.242939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.218129Z","title":"2025 , eprint=","venue":null,"work_id":"085e33ef-8c74-4c2f-990c-10681f0989bd","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.918039Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:967182eb2720081c08527f203241172a1821868be3062f33d6b560684ff44813","observation_id":"4290319c-0200-434a-b1a4-ef745eae8798","resolution":{"observed_at":"2026-08-07T04:24:56.223694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.922152Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.922152Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:16f8128c54ff3cfb152956b0081e8d2f210720673928dea4d36447d31414c2ee","observation_id":"fe6093ce-4615-4fca-a0e7-e9bed56f58aa","resolution":{"observed_at":"2026-08-07T04:24:54.922152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.926274Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.926274Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:d39324c2d6790cf9492e92c61a40659e4cbf2c4939a807b0a5329a8bff63546b","observation_id":"95aa17f3-0196-46c6-b638-0ca70215d7d3","resolution":{"observed_at":"2026-08-07T04:24:54.926274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.174811Z","title":"2024 , eprint=","venue":null,"work_id":"2465f180-6777-4047-bb0b-cbb37e0e6905","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.931250Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:16d32054ebf6b14ecb18404c0ca09757b2942756e24d1cfc60ed6a036331482b","observation_id":"42bea15d-cbf8-483c-b6a9-f9a4b53578d6","resolution":{"observed_at":"2026-08-07T04:24:56.179831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.935746Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.935746Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:be893ab0f7ede44937ed82b121dd812a42154ced7a78988db989531affda3ba0","observation_id":"15e4ae1a-fc2e-4373-9667-8bfd1a58c922","resolution":{"observed_at":"2026-08-07T04:24:54.935746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.939825Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.939825Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:09a87a0a86df4f68e6913413d2c17aa6c130ac7a76f1888b0d7a453d8b4b31da","observation_id":"9aeaa774-301f-46f9-ab75-6440462d76a2","resolution":{"observed_at":"2026-08-07T04:24:54.939825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.128454Z","title":"Proceedings of the 42nd International Conference on Machine Learning (ICML 2025) , year =","venue":null,"work_id":"b1fc9ac4-ad02-4e4d-bb9f-ae78a7d5a926","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.944352Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:1258e9db405a91d45df76fb374768e9c2e5223268a9adaa46c69c8d9b2c647d5","observation_id":"a6797bd3-346a-4119-82f5-e3ecdddf8424","resolution":{"observed_at":"2026-08-07T04:24:56.133964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.107995Z","title":"2025 , eprint=","venue":null,"work_id":"5998cb40-2f28-4959-af76-2e7fe938c4a1","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.949338Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:350dcea5be4e17c7dc7e737b1f47145a707f7482d4c4ce2f90d607f45d9fe816","observation_id":"8e7c17d2-d4e7-448a-9acf-e130fe5d8cea","resolution":{"observed_at":"2026-08-07T04:24:56.114458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T04:24:54.955160Z","title":"arXiv preprint arXiv:2203.11171 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.955160Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:941a0003ca544615de37438f646ef916a941014c47d5144979e56d616815bcdf","observation_id":"779460ca-fa69-4b33-b59a-c3a0e5d7bffa","resolution":{"observed_at":"2026-08-07T04:24:54.955160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.960617Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.960617Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:72d042167ddd3bc23893c5d242c6940ec60523afff0e2bd8e051361ebdeea5db","observation_id":"2283cd70-da8b-488a-a33d-4d1eaa6eec6e","resolution":{"observed_at":"2026-08-07T04:24:54.960617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.965931Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.965931Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:781de69924cdf3ccc613e7fc7f7ca96866500fac2c102d617c37dc47fa29ec4f","observation_id":"bcea1e89-b1a5-452d-9e38-2ce30b87d4b6","resolution":{"observed_at":"2026-08-07T04:24:54.965931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.970881Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.970881Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:362bc376f91aba2ae489824810e7ecfa9daec7773f293ca7794d40910e41f748","observation_id":"95794f40-93bf-49ef-8cf6-3c44bd445f98","resolution":{"observed_at":"2026-08-07T04:24:54.970881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.048677Z","title":"2025 , eprint=","venue":null,"work_id":"72e543a9-30f7-4c00-8db1-5f5297cb2608","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.975540Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:b5b30750f23fff58fa636da8ff3acd073676509f85a6a78703da25f2f9a33c3b","observation_id":"cbe1aa48-295d-4d78-82f9-45ef25c57e8e","resolution":{"observed_at":"2026-08-07T04:24:56.054314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-04T15:53:11.168523Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-07T04:24:54.981358Z","title":"arXiv preprint arXiv:2406.11303 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.981358Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:4608fedbfca4ef519279e0c7e8104d725cf5d97b3f91236e633decd564817299","observation_id":"e059e240-3680-4a48-8baa-dbd830e98b72","resolution":{"observed_at":"2026-08-07T04:24:54.981358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-07T17:42:30.374808Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-07T04:24:54.985958Z","title":"arXiv preprint arXiv:2405.08813 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.985958Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:5d1118b183d1bcd9af75985387703ad17a13131a646b1556c22ef8ccf67afed0","observation_id":"44b4a782-ef62-4217-b57a-179974c28124","resolution":{"observed_at":"2026-08-07T04:24:54.985958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-07T04:24:54.991413Z","title":"arXiv preprint arXiv:2501.13826 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.991413Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:c77d71e3ec3dd45755d5c209ec83e78a4076e2bbb711ddf7d9ee443640c73d42","observation_id":"4e648f65-6112-46d9-9f6a-e5484246083f","resolution":{"observed_at":"2026-08-07T04:24:54.991413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.032349Z","title":null,"venue":null,"work_id":"d6400481-2c4a-4d66-80c0-30f66dee23f6","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.996689Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:24afc74a603ad0c27ccf6293d0094101457a94092a068ce2ca27204a41b35bb5","observation_id":"6472183e-2c3b-4b5c-9936-59eaf987834c","resolution":{"observed_at":"2026-08-07T04:24:56.036757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14321","last_updated":"2025-05-20T13:07:55Z","snapshot_observed_at":"2026-08-07T23:44:06.171904Z","submitted_at":"2025-05-20T13:07:55Z","title":"Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14321","snapshot_observed_at":"2026-08-07T04:24:55.001360Z","title":"arXiv preprint arXiv:2505.14321 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:55.001360Z"},"links":{"cited_paper":"/paper/2505.14321","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:cbdfbc98f572000c32fa3b783de975405aee01f13f0e4173914615311ad99176","observation_id":"cd04825c-b05d-4ba5-9fad-add7deb39880","resolution":{"observed_at":"2026-08-07T04:24:55.001360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.013621Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings , year=","venue":null,"work_id":"8d4ae19b-fe26-40d3-833e-0cc6908a32d3","year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:55.008240Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:2de860db647088fabf943c38ca916b8252a01b68f1842860dda4ff77b2edc4fe","observation_id":"529b2d0c-38a0-4bd4-8414-23b60bbb4008","resolution":{"observed_at":"2026-08-07T04:24:56.018883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T04:16:32.987975Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":45,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2608.06361."}