{"as_of":"2026-08-08T22:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff3c4f62e4f15b2338a7f0e2942a988ab395a71af8242d2bf54a63faa5ac2d56","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:09:07.794518Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:36:44.033728Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T20:21:57.873354Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2404.16994"},"observation_digest":"sha256:99bdba88f9fd1fd49e06419cd5dbc503bf47e623e02c1f69453b888cefffca0e","observation_id":"74c5ed68-2940-4fd2-9e99-9bb5617b6b00","resolution":{"observed_at":"2026-05-15T20:21:58.021092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T19:55:26.333923Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2406.04264"},"observation_digest":"sha256:641cf9703209ed688c9939d9eb4e241a1e195b1478982a942ffad15d7d453680","observation_id":"708ac9fc-961d-46f0-b59a-461ad3e71b9f","resolution":{"observed_at":"2026-05-14T19:55:26.439473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:3a9b44fe7ae971d9f70b65da71fe902624f51cc041682f42cfa968c342e969ae","observation_id":"a97ff8ec-0d4b-486d-9398-4b33d2e93a95","resolution":{"observed_at":"2026-05-11T02:44:53.638107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:491d7f73604b07d71a4b394f1216634c5f74152f5ffcd69822fc657949d85d53","observation_id":"2418df75-a193-48f6-88f8-3fdb91d97860","resolution":{"observed_at":"2026-05-19T11:55:30.104117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:1f19870bb141b64cc789e4cf7cb2d34d5b690b50b6d354998490617f82e0ae38","observation_id":"185a7090-b23a-4513-a028-018679817359","resolution":{"observed_at":"2026-05-17T10:46:28.677521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2501.05067","last_updated":"2026-04-20T07:42:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T08:43:57Z","title":"LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-23T06:01:00.775721Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2501.05067"},"observation_digest":"sha256:9244ae297ab95b4ceda044569b382e7472eec859b71142ff086899551f90654f","observation_id":"e7b9d41c-affe-4ba0-9377-5a65622b0cfc","resolution":{"observed_at":"2026-05-23T06:02:37.587807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:86c9914f2c3f13032e6f7a2e9415b7d551a339b940439451e1129e49a0dbd135","observation_id":"c87f1033-5839-4a62-b3a7-7730ec1d7bda","resolution":{"observed_at":"2026-05-14T00:32:41.261120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T20:23:50.552549Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2504.05299"},"observation_digest":"sha256:bd6409c4084220a6da00a2ab735ebd4be3f1f0f203a403c9fb6e13f4d53d5b6a","observation_id":"563dd0cc-1e6d-479d-beac-81df15334841","resolution":{"observed_at":"2026-05-13T20:23:51.770625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-07T12:09:07.794518Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00479","last_updated":"2025-05-31T09:10:43Z","snapshot_observed_at":"2026-08-08T13:10:06.261113Z","submitted_at":"2025-05-31T09:10:43Z","title":"EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:07.794518Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.00479"},"observation_digest":"sha256:e0be4b7eace74e8ba921a45c9f813f22442c2265d86e05e7410fd9fa797c7871","observation_id":"2042abbd-d90d-445f-9c54-2a82c3e8af38","resolution":{"observed_at":"2026-08-07T12:09:07.794518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-07T06:00:56.967687Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06275","last_updated":"2025-06-06T17:58:36Z","snapshot_observed_at":"2026-08-07T21:48:03.079145Z","submitted_at":"2025-06-06T17:58:36Z","title":"Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:56.967687Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.06275"},"observation_digest":"sha256:323c4b855951cc2962e7dfd3384b7bf2cbc46689ca409b7d93790c380da4b432","observation_id":"7e5fa39a-d49d-44f5-9ae8-4c8effec6e48","resolution":{"observed_at":"2026-08-07T06:00:56.967687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T23:13:07.554817Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.554817Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:a03c4e8e3a3c1bb8fb6b496f279da7ce4eeff953afe31e22cb1ae9579864a8df","observation_id":"82ed5029-2983-493e-ab0a-c3a858ba68dc","resolution":{"observed_at":"2026-08-06T23:13:07.554817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T22:36:38.567659Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.567659Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:579facb6d322956dfa7c4162871239636fdb7818adc80f9feab7320eff3c5ea1","observation_id":"b25ca4dc-5cdc-466e-a600-f35ebdf1f7d5","resolution":{"observed_at":"2026-08-06T22:36:38.567659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T22:24:32.112310Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-07T08:24:31.697101Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:32.112310Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:f57b2ffeb8b7510258674e84d2e2e166e7eb086971a352c6ba63c82ae58826de","observation_id":"72519638-fa77-49ec-9ce6-613012807379","resolution":{"observed_at":"2026-08-06T22:24:32.112310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T20:29:54.291657Z","title":"Moviechat: From dense token to sparse memory for long video understand- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-07T06:17:01.457380Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.291657Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:725e7abfb7546ea5997cc7e1172e9150cfee92170ad8367130bbf6212687a2fe","observation_id":"00d8e688-0c33-48cb-ab53-274cf486fbfb","resolution":{"observed_at":"2026-08-06T20:29:54.291657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T18:10:13.357356Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.357356Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:674a6e20d21cdee7dc2068d25cd638c7107c6bb83c576a6ce76cea31142c3c1c","observation_id":"102ccd94-8ead-4ada-9021-3f44632e9396","resolution":{"observed_at":"2026-08-06T18:10:13.357356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-03T15:26:15.102987Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.16978","last_updated":"2026-06-16T16:38:58Z","snapshot_observed_at":"2026-08-07T04:10:11.766593Z","submitted_at":"2025-12-18T18:59:27Z","title":"A Benchmark for Omni-Modal Reasoning in Long Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T15:26:15.102987Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2512.16978"},"observation_digest":"sha256:317620e9c21dd40cd666fecf04f6f9508bfeb231f9b91a3cb6404aaa7a047e6e","observation_id":"19bf8d62-97ee-45f3-899e-35f5b9155968","resolution":{"observed_at":"2026-08-03T15:26:15.102987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2307.16449 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:09b3393dc6ad98882fd7b484017eaf95d9b89a9f92c5e18c2e3052c0d2807ff4","observation_id":"86eb29da-14cc-4620-8d25-37ab3170b275","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:7af2f30b3f31ac690609d3078e227f07efa5e04e68e7a3f94c8e8cc90ddb41af","observation_id":"9cf2f7bb-d52c-4ac8-b6b2-80c9624b37db","resolution":{"observed_at":"2026-05-14T22:08:04.369292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2307.16449 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-07T09:23:25.859554Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:de4d2abf032682d30ed0b745fafc6589717697f750a22a642ea65b4d21f7a494","observation_id":"3b51cd7a-8a77-4cb9-82bd-64ac814881d3","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2605.17065","last_updated":"2026-05-16T16:15:59Z","snapshot_observed_at":"2026-08-02T03:22:29.983512Z","submitted_at":"2026-05-16T16:15:59Z","title":"PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-20T15:12:00.408851Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2605.17065"},"observation_digest":"sha256:58cabc316c2f3548c68c3fd9e3f9a811ce115017adacc402623b9f085334c10b","observation_id":"7aeb8240-0e45-4502-b046-84e21d5d72cc","resolution":{"observed_at":"2026-05-20T15:13:24.841282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2606.05736","last_updated":"2026-06-04T05:55:15Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:55:15Z","title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T01:52:44.785582Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2606.05736"},"observation_digest":"sha256:43ba046c61f68271e37e01a687ed53d241bb85889cc26ff1e526cb3525100e27","observation_id":"6de1d70f-fa3b-4953-a909-62890ec284c5","resolution":{"observed_at":"2026-07-02T12:46:56.837302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:acbbb30665fc67b149f5b50297f4e205f8314ff86a89c86c397c7afb90f18f6d","observation_id":"bd657a2e-9658-421b-9a36-6bdfd12428c0","resolution":{"observed_at":"2026-07-04T06:39:37.661744Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2606.29445","last_updated":"2026-06-28T15:11:19Z","snapshot_observed_at":"2026-08-02T18:05:44.581086Z","submitted_at":"2026-06-28T15:11:19Z","title":"Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T07:48:01.719339Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2606.29445"},"observation_digest":"sha256:19595662a3dcfb8908d5696c6a45b157093cf9ee63fc61c1394a8a84fe2d6541","observation_id":"8be66e76-6987-4810-81f7-d6d89584efc9","resolution":{"observed_at":"2026-06-30T07:54:22.343008Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-12T11:31:14.532101Z","title":"Moviechat: From dense token to sparse memory for long video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02551","last_updated":"2026-06-26T16:05:57Z","snapshot_observed_at":"2026-08-06T08:59:01.715141Z","submitted_at":"2026-06-26T16:05:57Z","title":"DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T11:31:14.532101Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2607.02551"},"observation_digest":"sha256:086e14ed56691f56b592ad7dbd5bc6aa57980e900999e8c6c1cec448aa2dd904","observation_id":"1b204ed7-b544-4d00-b49a-40961db8e10f","resolution":{"observed_at":"2026-07-12T11:31:14.532101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:b6ec04e76b5213872d68338e419567ff731e48a9707b6187e6444eeec066c645","observation_id":"21063b64-1987-4fb9-add8-35b26a601fe8","resolution":{"observed_at":"2026-07-10T01:36:44.035222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2307.16449/citation-record","integrity":"/paper/2307.16449/integrity","json":"/paper/2307.16449/citation-record.json","paper":"/paper/2307.16449"},"outbound":[],"paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2307.16449."}