{"as_of":"2026-08-08T07:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b963af202893da1e433c5b250e887813b8579cad45d5b5fd899dee3c00f12f7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:40:46.777607Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:48:03.110683Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":"2312.04817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-07-03T10:48:03.110683Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding","venue":null,"work_id":"ecace4d0-749e-45f2-b598-0cfe1ccc1cc5","year":2023},"citing_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-17T20:22:34.954228Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2311.17005"},"observation_digest":"sha256:2ccd4057f04d45bb15f20ec01e9a2aa8b3bd4f3dac6e9d1837f4a2053d2fd7bd","observation_id":"4ab2a01c-661f-48cf-84a2-5a7e27e45e4b","resolution":{"observed_at":"2026-05-17T20:22:35.159910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":"2312.04817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-07-03T10:48:03.110683Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding","venue":null,"work_id":"ecace4d0-749e-45f2-b598-0cfe1ccc1cc5","year":2023},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:386710aa403abde7114c9fb78bf99c64ac08ad01726cd642f2b2195031fcc603","observation_id":"ae72e675-30fe-4b74-869a-5384faed57bf","resolution":{"observed_at":"2026-05-19T11:55:30.142703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":"2312.04817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-07-03T10:48:03.110683Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding","venue":null,"work_id":"ecace4d0-749e-45f2-b598-0cfe1ccc1cc5","year":2023},"citing_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T04:02:43.261543Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2501.00574"},"observation_digest":"sha256:9f691cf21b1b37e1f77e2c41f02015902e0db3abe1b7b682c6ab6504170a0329","observation_id":"428835ff-04fc-425d-834c-bd2a36c4e492","resolution":{"observed_at":"2026-05-18T04:02:43.607191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":"2312.04817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-07-03T10:48:03.110683Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding","venue":null,"work_id":"ecace4d0-749e-45f2-b598-0cfe1ccc1cc5","year":2023},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:461dd679019ab0f9682fbb1eafdf4f0126aee7bd7f1e12a1de9cdf62be2bdad4","observation_id":"957433df-c785-46cb-a36e-7d1aaf9c4f52","resolution":{"observed_at":"2026-05-17T02:52:20.823715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-08-07T12:40:46.777607Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-07T12:35:51.712975Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.777607Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:7a6829ded95ca017eb6daac63603c1f985bcc1a308451813e1d7ad12885fb3d7","observation_id":"ec5f4923-2264-490d-828d-3ffec31585c1","resolution":{"observed_at":"2026-08-07T12:40:46.777607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-08-07T10:29:10.653423Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding.arXiv preprint arXiv:2312.04817, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05287","last_updated":"2025-06-05T17:44:12Z","snapshot_observed_at":"2026-08-07T10:19:21.034875Z","submitted_at":"2025-06-05T17:44:12Z","title":"EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:10.653423Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2506.05287"},"observation_digest":"sha256:2cae377286f83ca2f63e897a187ab9dafe92a8f43d4c4032572e8b43ef415073","observation_id":"c50a5b54-c58a-4ec4-a0ec-576e08ced5d2","resolution":{"observed_at":"2026-08-07T10:29:10.653423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-08-07T06:00:57.022279Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06275","last_updated":"2025-06-06T17:58:36Z","snapshot_observed_at":"2026-08-07T21:48:03.079145Z","submitted_at":"2025-06-06T17:58:36Z","title":"Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:57.022279Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2506.06275"},"observation_digest":"sha256:6caa0869c63b652d19cbfc4e4b51f3e418749fe17a3cbf5547da03bc04309a6d","observation_id":"21a9f31e-4cd3-4917-a883-0863f50c32fb","resolution":{"observed_at":"2026-08-07T06:00:57.022279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-08-07T04:22:56.102015Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-08T00:05:09.574699Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.102015Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:1720a5918a829916a94f68c6312f71c1984d8cca68c0ca96a627bfc4287f3a32","observation_id":"636a398c-4161-4ff9-b1c1-fda5a06ae8a4","resolution":{"observed_at":"2026-08-07T04:22:56.102015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-08-03T15:26:15.994865Z","title":"Movqa: A 10 benchmark of versatile question-answering for long-form movie understanding.arXiv preprint arXiv:2312.04817, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.16978","last_updated":"2026-06-16T16:38:58Z","snapshot_observed_at":"2026-08-07T04:10:11.766593Z","submitted_at":"2025-12-18T18:59:27Z","title":"A Benchmark for Omni-Modal Reasoning in Long Videos","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T15:26:15.994865Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2512.16978"},"observation_digest":"sha256:dafc51d37e3a86d28f01d76699248160aa93d58e3f216d4a0c82a34c7a170a66","observation_id":"a879c858-06fc-482b-a4a0-6b52e9ec6ad2","resolution":{"observed_at":"2026-08-03T15:26:15.994865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":"2312.04817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-07-03T10:48:03.110683Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding","venue":null,"work_id":"ecace4d0-749e-45f2-b598-0cfe1ccc1cc5","year":2023},"citing_paper":{"arxiv_id":"2602.22779","last_updated":"2026-06-03T09:11:47Z","snapshot_observed_at":"2026-08-02T20:38:33.149530Z","submitted_at":"2026-02-26T09:15:34Z","title":"TrajTok: Learning Trajectory Tokens enables better Video Understanding","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-15T19:11:52.694778Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2602.22779"},"observation_digest":"sha256:02c601599ad759b7c5abebc8a3d987d8903a2f440b6addcd9646784ae2a761e9","observation_id":"26c1f211-0800-428d-97b7-f0a13df8ef32","resolution":{"observed_at":"2026-05-15T19:16:31.804229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-08-02T20:38:45.233510Z","title":"Lvbench: A benchmark for long- form video understanding.arXiv preprint arXiv:2312.04817,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22779","last_updated":"2026-06-03T09:11:47Z","snapshot_observed_at":"2026-08-02T20:38:33.149530Z","submitted_at":"2026-02-26T09:15:34Z","title":"TrajTok: Learning Trajectory Tokens enables better Video Understanding","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T20:38:45.233510Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2602.22779"},"observation_digest":"sha256:18f0e3d0b58c64c3ce4bb1314addaef1a84e1e251ad84fdbc4771889ed24b3b1","observation_id":"175555d1-b992-4fb6-a7d0-6e7359284945","resolution":{"observed_at":"2026-08-02T20:38:45.233510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":"2312.04817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-07-03T10:48:03.110683Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding","venue":null,"work_id":"ecace4d0-749e-45f2-b598-0cfe1ccc1cc5","year":2023},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:9adae3d1392e90ccbf350fc827b8ee47444d48911f55403aa9c525f6f52fef72","observation_id":"a02539c8-ea59-4b32-ab75-9be824ef1ee4","resolution":{"observed_at":"2026-05-14T22:08:04.437856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":"2312.04817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-07-03T10:48:03.110683Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding","venue":null,"work_id":"ecace4d0-749e-45f2-b598-0cfe1ccc1cc5","year":2023},"citing_paper":{"arxiv_id":"2606.05748","last_updated":"2026-06-04T06:20:23Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:20:23Z","title":"UNIVID: Unified Vision-Language Model for Video Moderation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-27T22:56:26.674841Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2606.05748"},"observation_digest":"sha256:d2647a7f60616a9520443ca4d2f149221927a3b60092c27acb2855bd29f9debd","observation_id":"afb64882-6174-4dee-bbc4-b2650d69ff26","resolution":{"observed_at":"2026-07-02T16:07:09.257183Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":"2312.04817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-07-03T10:48:03.110683Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding","venue":null,"work_id":"ecace4d0-749e-45f2-b598-0cfe1ccc1cc5","year":2023},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":299,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:31a6fe4c6937ea69971a82fc9ae547afd39b53910913c27048d35c972f2bccfa","observation_id":"6aca7357-35da-4e1d-bc2e-ad6192927c40","resolution":{"observed_at":"2026-07-03T10:48:03.112146Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2312.04817/citation-record","integrity":"/paper/2312.04817/integrity","json":"/paper/2312.04817/citation-record.json","paper":"/paper/2312.04817"},"outbound":[],"paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2312.04817."}