{"as_of":"2026-08-18T01:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a07a2bba9b73e691df79349e44a367600b72763244ebec7efa5cb61a838f381","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T15:29:31.834566Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.29943/citation-record","integrity":"/paper/2603.29943/integrity","json":"/paper/2603.29943/citation-record.json","paper":"/paper/2603.29943"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"dvd-counting (2025),https://huggingface.co/datasets/Video- R1/ DVD-counting5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:62b9de3db5d432ba89ec07a833a6ffae8c1da45ee277746725de6762d907d70a","observation_id":"c0ed3337-2573-40ac-87ca-3721e43e4345","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:2166703bf4cf601a757314328de2ba78032037d93a87acd1e61e3d55dfb62ec1","observation_id":"ccfdbbf5-5a00-481e-97a9-1403717cfa24","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:bcf9644b58f0902fab4d006322fb8cb68df2ab27c3b05512b0acdb6afd1198f4","observation_id":"804a42b5-7a60-4670-9785-7d4fedafcaa9","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01234","last_updated":"2025-01-02T12:49:04Z","snapshot_observed_at":"2026-08-15T02:51:55.812537Z","submitted_at":"2025-01-02T12:49:04Z","title":"Impact of QCD sum rules coupling constants on neutron stars structure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01234","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2501.01234 (2025) 9, 10, 13","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2501.01234","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:0d4686eaef9c7378bf00f7d6b7694558b30b1508cb3a0e175b17299db0e9f4bf","observation_id":"00532c8c-7292-40f2-9624-507adeba4a22","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: Proc","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:9cddacc43c908da365187e92806bd821f0ae432bc809967663b3fd20e1c4f64b","observation_id":"8826dd5a-a126-427a-8a97-9b9ba5282037","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:1ea4c887814bee7ce58b64e5b2310af4c75d6c29c5f6e63b73e5439292508615","observation_id":"b1107bf7-52a0-45cb-b826-5e2ba0abf8f4","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:5b32333e7c04229968749c9743a9cb09186a29fcd8c0a9bcf925d29ac3dfbf70","observation_id":"e575d683-7aa2-4ff2-b583-ed45f34cb77a","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: Proc","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:529a014a4adf80f5a1ee24770ab9ba0ce5ff6cffc9503f3c67a0b3819faab376","observation_id":"0a34462d-4c2a-4aeb-87fd-620d93537238","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: Proc","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:301a7953a9e04ea705abc57a7e2ac365cf4bad783c4ab74d405760d71d1c5733","observation_id":"56c174e6-4159-4103-aa53-e9edd3ab8263","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:56dd291339d0ee05829c14f6370baf252c24b2c217833b90e6eade4db699491e","observation_id":"f375ed06-2c9e-41b0-adbb-339d09b3cc55","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15418","last_updated":"2020-06-27T18:00:42Z","snapshot_observed_at":"2026-08-15T14:47:32.817782Z","submitted_at":"2020-06-27T18:00:42Z","title":"Counting Out Time: Class Agnostic Video Repetition Counting in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15418","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2006.15418 (2020) 3, 4","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2006.15418","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:3520f2706a4adc1e8b73554610db81a1c8924fd93c21c473b8bb3d85b41b7a47","observation_id":"6706b4e5-7c7a-404a-960c-f5aa2a3f9b18","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17085","last_updated":"2024-07-24T08:22:49Z","snapshot_observed_at":"2026-08-16T13:31:31.054399Z","submitted_at":"2024-07-24T08:22:49Z","title":"OVR: A Dataset for Open Vocabulary Temporal Repetition Counting in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17085","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2407.17085 (2024) 3, 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2407.17085","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:a5b524149f4b5442b84c0e9b12301ab4a812027e0f290b214e8e0f3a2212cf50","observation_id":"476a509e-539d-4ce4-997a-ba7abc5e2460","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:4a345c177e3e8b90af413a042fc80aac277e67a96aa8c739a7a06deda307d230","observation_id":"2a95aa4f-5c26-4199-b8af-b40f04e34606","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:699b4fe4046471fe5e11fa48a584ee38f511a29bd3cedfc557c8c44222a9b8f3","observation_id":"3f123ddf-3781-4231-bf7e-a13133ebae2c","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:41eeed3cd9f162d7160373019554245c73447f9b432e4fc59876479f4833ffd3","observation_id":"a4809d89-b79e-43f4-ad98-b08c634156de","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:77d1b6c0d8aa0903d072186fe4486ef957733fd014d0360f77b82b4f82dbd1b0","observation_id":"90d7b2a4-46a9-4e58-8023-a5d78e95ef2b","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:e7f8c70bfef010bbfea924944b7e01b7cf81ad5b7a14f0923ac928853c1783db","observation_id":"7767d1d7-f8c2-4994-a2dc-a97a5919c8df","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-16T14:34:47.701708Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2312.08914 (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:1cb8eb74a53ec063e56dd4cf18418162f5bac8795089f00bbdfd4d16e1d30cfc","observation_id":"db48a1f3-5977-4056-9f33-511c1ac79750","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01018","last_updated":"2022-04-03T07:50:18Z","snapshot_observed_at":"2026-08-16T17:09:41.592144Z","submitted_at":"2022-04-03T07:50:18Z","title":"TransRAC: Encoding Multi-scale Temporal Correlation with Transformers for Repetitive Action Counting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01018","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2204.01018 (2022) 4","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2204.01018","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:90757ef55eb97ff56799aeec1038992434398c1ce9f722e65e9e5bf0edb89e0e","observation_id":"0ef59c24-cbd3-4af8-986f-5689011920a8","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: Proceedings of the IEEE/CVF Confer- ence on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:972fe11edf035ae23240762934370a95f682ad8dcb4666bea13ff9cfb44a4310","observation_id":"7d6f55b8-76a5-4773-a915-284b51c6642c","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: Proc","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:4b3db53c6a6a9e49f07571ca845fa196370a83eaae4c0d2bbd9c7237b7bd2233","observation_id":"b92e31c7-5166-4fd0-97ae-946fcc4a31f5","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: Proc","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:94ae1544e72743ca512002a3aed8810e5f6cd15cdc5e5d2f2b81f9878edaa5ea","observation_id":"2e4f79eb-5a8f-4d25-8a02-8a5befd316a9","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2307.16125 (2023) 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:db3c868032d30e7fc66da2e48dcb531023c6966d86414c0f9ae00b1d60caaaad","observation_id":"652672de-4758-4041-bc40-8dd0e5fec5e8","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-08-14T11:10:08.135537Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2311.17005 (2024) 1, 2, 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:9bbeb66c61df11d8107bc50c76eb22420c7a98c176d6384c46156ec06b72c0f5","observation_id":"f3b5ea87-3001-41a2-b6e4-a5b1c3405525","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"International Journal of Computer Vision (IJCV) (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:5a5dd78e0a9d17815e7c2c4edf67b1242101793f2015ae0b76f476f3a5f3cda2","observation_id":"1bca8f0c-0c1a-4715-9aca-3a571f0b7a17","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2501.00574 (2024) 9, 10, 13","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:164aa98e6c1a2c956dde9d33cad52b1c66485780961bf6b8cbee58bf6c464428","observation_id":"755d7aae-8794-410d-9ab5-18f342f58639","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:532d78a1a3dc1d1510b95cfb7a12a63409959eb46564cc99acc357313c65c783","observation_id":"702c9dff-67f2-4056-a900-13e5dc7ab1e9","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:88de01de25dac46759a026acf7563f40fc6d15837dc8855ed9e6daf49fffd33e","observation_id":"0ff59474-1b03-4ea9-8519-36f6c35fbf6f","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:d548069104f9a1a9155c49be6ae9c8e34346d5a4d3381998aa2d882fd0aaddc9","observation_id":"67c97e77-4fd0-4bff-b8ba-815a46bc41e7","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:bd719a12191544a6d0344aed078105e9dd1416c7f6ff9fa37a5a15275996b8ff","observation_id":"37c0a396-ed8b-427e-9898-437b1c4e7343","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:0c55b09faaca141c388aac395042007b8ff98284a01098f27f7d67d404a21fbf","observation_id":"e58f5a4b-8ebe-4546-90c4-a2cace6ff33f","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:2bcdd349336c26d62d5cfdbe0eb6a26ac073ac503666439bb12ea905feb2b0eb","observation_id":"1f313c1d-5eaa-48fc-84bb-92876d8168f7","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:6e9681418253dc4bfc8d3e28c8a01dfa6b4b887f6d59d4e0dee2c2b69a3deaf4","observation_id":"e611a130-8917-4efc-a10f-00357d38a65e","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:59c670cec804538ffb72eaccf0eee9ecdc18b0aff2460e4b2c6fa330c4fdc69b","observation_id":"0a36fe93-f34f-4e64-b924-f1eba642acd8","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:5ca7748dd0ee672ad5194ec10a15c9d68bc45ff8a4689daca5156411ccef745b","observation_id":"37a7df40-af6e-4179-96a0-e5ad009731e5","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:7c3d7624625f92f58667cee4b99bc27fabdc2262127881247416dc4ad2514610","observation_id":"40bada1b-f8fa-491d-bc78-80bc7ba915eb","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: CVPR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:51c9d955d4b25bfc854711b4399da9b1162642be1402cf42539ccf39633072e4","observation_id":"675a4a0f-d845-4d43-ac2c-a081c4899b5c","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:d1b95190c8eb950ccd341fee1882f0237ed6985641fcd2227850d97eb7a4cc9a","observation_id":"11679931-ef5c-4286-9e68-013018a43f38","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:5ca01a311c620fbbd1a0cdb4f946565d919c8769b910a1c1cbf29db8e71f68c7","observation_id":"77a2d1bd-0193-4ddf-9694-11e574b97d3b","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:dfa6f735593561c650edfe8717da5c98ef6e5881e38ec1f136137810c110bcc7","observation_id":"d21dcb1d-2e39-4203-b20e-b146f1697db8","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: ACCV","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:f4e8a06298935dc9450d48ac895b10d986cb80a7a9f15a6feaf6e9ac05566b20","observation_id":"286b55c6-558c-4b30-ae4e-fc61cc3827e5","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-17T16:14:50.126982Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2307.16449 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:865487829c39991ac40ca13504dec5c72425462c627f6ca82f938235489c9179","observation_id":"3b51cd7a-8a77-4cb9-82bd-64ac814881d3","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:366424a598ba96badd516d7c2ac6a13e7a4bd0d079677286dafab6836593c952","observation_id":"ac061521-df25-4c68-b180-ebf01ee103dd","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: Proc","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:3e23f80839660225ed676f7ab59bd83d5a56e9dae5da3bafbe83c920d6d51446","observation_id":"6912cdf8-c52d-4c74-82f2-8229e65355f9","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: Christodoulopoulos, C., Chakraborty, T., Rose, C., Peng, V","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:8d42ce4879f554cdc4b2b40b3f46bd723469bbe3b4d212d4e22c6b600781d495","observation_id":"c7c893b0-f5d4-4a08-8dde-44eb5cc60279","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2501.12386 (2025) 9, 10, 13, 2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:2a36581f9210361183bba591481e6f1423de49dd10430af0a3164ae45655f74b","observation_id":"0eb35f2e-c345-452b-ac95-bdcc3ba2d825","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:84bc97e280223fbcc066bbd5f473fa9f5fc6b385b2a906579bd526304227e2f1","observation_id":"17d55405-9cd7-49bd-96ae-50a85ca897e3","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:ef501ed0dc23582e5e3126e40126516d885d27cbcddd7a2e5467fa769b92a572","observation_id":"f39f9fec-660c-43a4-9bc5-342adc06b57b","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:b53b40297b5ba214dd05fb0dc035514ae50340883ffd94c0a998dbe91325817b","observation_id":"4eee96df-b7dc-44e8-8f47-3647f735eb4c","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence (AAAI)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:ea3ff6be76c7f07b6bd00afa281e48df3bbb2c5e4c38828ffdd86341ab6f24a5","observation_id":"6adbf44f-b125-4095-8ee7-f3215cd78be1","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:161e85d9ddb185940c350e9f9af6ce0ebea98debd6288fc83a7ce83f78166882","observation_id":"16169e3f-cf25-4cbc-acac-4cce63c82a2d","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-17T19:14:29.958482Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2506.10857 (2025) 1, 4, 5 18 F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:3e78ed853ed793629319e7cb57e0e077137489b88fd5a2da8d29bfa14c006178","observation_id":"ca25f97a-b15e-4692-acc8-dac577a40f42","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:7fd0f444216c5d4b1a952107668a5045c069b0796195c0271414d39a8b885038","observation_id":"1e8ff0c5-88d5-4fb0-88b7-d9a6b55afeed","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:786dd3e3b2003f90840e05a799cf8b173c72ffa63a57555b5924a1d797d48060","observation_id":"db4f02f7-8b39-45bf-b1ae-326672b365df","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05678","last_updated":"2024-08-11T02:59:11Z","snapshot_observed_at":"2026-08-16T13:27:13.050519Z","submitted_at":"2024-08-11T02:59:11Z","title":"Efficient Federated Learning Using Dynamic Update and Adaptive Pruning with Momentum on Shared Server Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05678","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2408.05678 (2024) 9, 10, 13, 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2408.05678","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:4259dfc5554b90e78c09360a37e06ad6e150ac2111709a5a05d524b4a99cf753","observation_id":"be49c211-cdbc-4339-a170-d09b59814185","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:b5ad3dabb39c7fa96c9ecff439ec4259a06e898f906efc95ecdb80b59a8cda2c","observation_id":"b9a296c9-7c06-4df7-b58f-81e7822946ae","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:504467cf919b06018413f1e1d7d32b8da286c4f1166e01fbbedb05cf4ce57191","observation_id":"b11bc318-c7a0-4bcc-9ed1-bdb637f09a4a","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2410.05352 (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:3dae994059489f36a46e8b0a285470cda8144471e6f2d91cdfb7c2398740b870","observation_id":"e46c991b-4950-4dc0-8dd0-9ad9395141a0","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"In: Proc","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:771a433dc42f9101f00b69a948e11f6c52c46e60f1f363db403142877cab24b9","observation_id":"ca3ed385-a652-41ec-9209-ab25869adbca","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:0df54610d53fb64cbd733a707973b81649803ccfd013944c716d1bd240da6020","observation_id":"6117d422-0046-429f-9cd8-cf484ee13ed7","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"[ts, te]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:1ad0223e262fedc5bd4b4f505d4d8602f85d85f75b73653f70daebb3602da3dc","observation_id":"a99a6f1a-ad60-4219-b01e-7867ecc850de","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"–Keep expressions concise—no full sentences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:17e64d4f3af9fc31b13b77a526ab50e2507af8020e9744caa316a20af62badc4","observation_id":"bf463ecf-7e46-4ace-bf32-35f411162524","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"queries\": [ {","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:cf41b819ab3036e2a334cfc2470e8de77ea15acb45c329f9513ba789d7cd6c02","observation_id":"f2c22588-c851-474e-8afb-c6107aa3775a","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:9b0b7fa538eb3724427ce9b891b6624a90988f0d47dd884836cf20e7d323cebf","observation_id":"8210e5c6-f6ec-4aa8-93fd-1a91e85bf440","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"→” –No explanations—items only –Omit ownership names (“A’s car","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:d0ad27310a1127e0e26410b3d05263d2a15643c8282854ad82175f4eba9c645a","observation_id":"35835793-a8fb-4204-8c43-b38aa76b3b2a","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:4b33e35fbc65780b5447bec5b552b3ccd2b2e982abce177d2b0f372716413e7d","observation_id":"5b08aae6-ca5d-4903-b6d6-c92fe29aa731","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:38bd42af57742acb3ec39fdf7ba54f97deb396baf02cedd7ff670823c40a8716","observation_id":"544f6b99-1430-4a0e-930e-031399628669","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:546e2afd65956b701703a78123c3174328f78cc33548d126c56ddeb346588520","observation_id":"5a55303f-9596-4009-bbb0-a1e30663f575","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:be0ea987756e9e9e6c0d3bfbe8afb3c9c85ccdb76b6d5526215e9b75e7ab4805","observation_id":"d8b83d75-195b-4b8e-966e-aa0604f84a2c","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"results\": [ {","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:770657537141ae5d8677d414df9d5cc195c59a5927cf8dac7d9d561083c527e2","observation_id":"4c4a9421-5198-441d-b6e7-22c2ad35c4f2","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:1332e8327db0685c458520645731902951050254e23119a1d1b365df37291e83","observation_id":"6fd0a3bb-3530-44ad-a2fd-b04c7949e226","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:b9063ebf445227ccea10b4d2eda655a31151721441ae4c3fd74665ba79a14814","observation_id":"2f6e8122-8ee3-4b36-8c6f-0fdda149589a","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:45076fbf9d7a443f95cc65f58697862dc24b54e17a17890c1823b5ca8a43a4e7","observation_id":"e79f87fb-d62e-4a50-ac39-06229a768b71","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:e615bc20b750977627ff6086db66630acc0272ede900f60bfaa4f7a3589d64ed","observation_id":"c581e8f5-de29-4806-b81a-581dcb01974d","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"enumeration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:822145b28347328ad2d39c908b3c6c773d670c155f9dac23be094fbe10ce97b4","observation_id":"40a31eac-f1e8-46f7-b84d-b72d50b9a9f3","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2603.29943."}