{"as_of":"2026-08-21T16:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:666e8dc5acd538aeb1a1459b0eac00c0532f1fc4dd8d7ae1596712eebf449970","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:28:35.241017Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T21:37:55.887477Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09263","snapshot_observed_at":"2026-07-13T21:37:55.887477Z","title":"Date: Dynamic absolute time enhancement for long video under- standing.arXiv preprint arXiv:2509.09263, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.20190","last_updated":"2026-06-09T22:16:34Z","snapshot_observed_at":"2026-08-14T21:02:06.734651Z","submitted_at":"2026-03-20T17:59:25Z","title":"CoVR-R:Reason-Aware Composed Video Retrieval","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T21:37:55.887477Z"},"links":{"cited_paper":"/paper/2509.09263","citing_paper":"/paper/2603.20190"},"observation_digest":"sha256:88c48cf4d4a6bfa2230125574bc6d5fadcb9902b7f6bbd760774f871309cead7","observation_id":"5c04fc4a-164b-495d-8250-15706bd20a54","resolution":{"observed_at":"2026-07-13T21:37:55.887477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.09263/citation-record","integrity":"/paper/2509.09263/integrity","json":"/paper/2509.09263/citation-record.json","paper":"/paper/2509.09263"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:30.931046Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:30.931046Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:e76b537266a592a4d24cf7ee382d45d39c90ebb159b2dbf10cecf29c9f688933","observation_id":"6cea1c6b-09c3-4af2-9218-279d935743ce","resolution":{"observed_at":"2026-08-04T19:28:30.931046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-04T19:28:31.043095Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:31.043095Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:398d8a504edc6058ec1f76ce4472ed794a44b16faf82debdce847b29ba9ce634","observation_id":"6c75c933-e1ba-4588-86d6-462aacd90fcb","resolution":{"observed_at":"2026-08-04T19:28:31.043095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T19:28:31.153924Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:31.153924Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:ef18af9d3d6f03199b29de021503a9e78df7583bd91315b48689f152780406ca","observation_id":"5dd4e9d0-4a99-4d0f-98db-59072db3e3dd","resolution":{"observed_at":"2026-08-04T19:28:31.153924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T19:28:31.349484Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:31.349484Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:cc56555bddf4d18c2871fcc045099cd592de64dc5aa8710a58db70f266792d56","observation_id":"e166203b-70e5-4cfd-8f51-2b98926b70e7","resolution":{"observed_at":"2026-08-04T19:28:31.349484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:31.468049Z","title":"Roformer: Enhanced transformer with rotary position embedding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:31.468049Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:1e29a2e5266f9ad38a0c852b74d2d4b17a31a87d4500c4d43ed1770e1d214afc","observation_id":"e97afe11-87d4-490f-8de7-50293f2847aa","resolution":{"observed_at":"2026-08-04T19:28:31.468049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-16T12:54:11.473223Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-08-04T19:28:31.595682Z","title":"Adaptive keyframe sampling for long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:31.595682Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:0ad7481905da0a4ecf80a62d463a1ac8e42bb0129d5eee3ad36aecef5207332e","observation_id":"cf1d15db-9e10-4c41-918f-dccbe1e2c010","resolution":{"observed_at":"2026-08-04T19:28:31.595682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:31.720004Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:31.720004Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:24f4c77127ae7fb243b31827b3882fcc84e9895a941bba584556e7aace5734dc","observation_id":"29e0a2e4-663f-4f7d-943e-8ffade73c217","resolution":{"observed_at":"2026-08-04T19:28:31.720004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T19:28:31.798706Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:31.798706Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:d8b8082f1bedced106640d12f4578f0667d06ecfa15b6039beb8536b00eaf788","observation_id":"6634ecc5-1a9a-4aef-b5a1-b43d5f433feb","resolution":{"observed_at":"2026-08-04T19:28:31.798706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:31.899722Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:31.899722Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:40e585664f39a009bdc0c011f59cd9a4f10877cfceb9e80e8c01c762fa3338d5","observation_id":"cc6ebdbc-ffea-4b5d-89ec-aad8bc74d4bc","resolution":{"observed_at":"2026-08-04T19:28:31.899722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:31.957700Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:31.957700Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:690dc47658e6971838e9f07b195777ddb00c1c96eddc51e3b2fdd142182c3020","observation_id":"b0bfc4e1-4f82-4885-950b-01b2402ad1bb","resolution":{"observed_at":"2026-08-04T19:28:31.957700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:32.155504Z","title":"Palm: Scaling language modeling with pathways,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:32.155504Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:ae0bd53550d2a65da770b0531c5b321ec21c0c827edc2881cd7580774644115f","observation_id":"ca93cbda-637c-41bd-8fae-f84d434f64dc","resolution":{"observed_at":"2026-08-04T19:28:32.155504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:32.255963Z","title":"Scaling instruction-finetuned language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:32.255963Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:a1f3463966c475cac479d8bbcdcfce3ae8c95665398f2557cf783c4547d014a1","observation_id":"0e27cd1c-cb58-48de-9798-7d54c9a12564","resolution":{"observed_at":"2026-08-04T19:28:32.255963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T19:28:32.332129Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:32.332129Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:1e1ac6f97d619ca84d1a2a5d1eb9c8538375312b7a794a08ff70128977c15ecc","observation_id":"7c3db572-5161-4eea-9d24-ce54b66efbae","resolution":{"observed_at":"2026-08-04T19:28:32.332129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T19:28:32.409193Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:32.409193Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:c222ae8543278737e3a507ef2e25b6ab5f8d7c8ba0f79fd0cbee81f7ab3259cb","observation_id":"cce955e1-8ccc-49e4-9d1a-fafbafd35fc2","resolution":{"observed_at":"2026-08-04T19:28:32.409193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T19:28:32.482894Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:32.482894Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:d3628d3a23dd9584044ff96dcc45dd99dd9492b9cea009a3fc4b635070fefb5c","observation_id":"5ce0c97a-7680-43e3-a505-1d8127a1d2fd","resolution":{"observed_at":"2026-08-04T19:28:32.482894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:32.552972Z","title":"Chatgpt: A comprehensive review on background, applications, key challenges, bias, ethics, limitations and future scope,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:32.552972Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:18ae32d163ef1c2cae65790da9115a5fdabe340e40ce70476878672650588f4d","observation_id":"46c9fea0-ba0c-4c96-9e4f-5f447ab6a67b","resolution":{"observed_at":"2026-08-04T19:28:32.552972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08024","last_updated":"2024-06-12T09:22:45Z","snapshot_observed_at":"2026-08-20T06:33:17.275611Z","submitted_at":"2024-06-12T09:22:45Z","title":"Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08024","snapshot_observed_at":"2026-08-04T19:28:32.618929Z","title":"Fewer tokens and fewer videos: Extending video under- standing abilities in large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:32.618929Z"},"links":{"cited_paper":"/paper/2406.08024","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:39905bf5d82368cc61468c415ffd0343e743e2e692e25f55e1c5e6e1a9b94e6f","observation_id":"857f07fd-9954-45a6-ad11-5ab223d512e0","resolution":{"observed_at":"2026-08-04T19:28:32.618929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:32.687197Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:32.687197Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:40142b7173c49e5b7c5fd7ab0ffbb7f82f5f123d89873403e1b07e14150293f3","observation_id":"55a0459e-e30a-47eb-93d2-2ea7c978ded2","resolution":{"observed_at":"2026-08-04T19:28:32.687197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:32.742111Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:32.742111Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:7270b1b3cd37aee3ad090737b61951b7043037fd2dfc8b8baa6d5db821384f24","observation_id":"5bfac942-3429-4c47-9b39-dfd7e4d5055a","resolution":{"observed_at":"2026-08-04T19:28:32.742111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-04T19:28:32.849254Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:32.849254Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:21e1dcda4a2871f193effcc76c93f2361aa5af0b7f828480fc86b473a970e291","observation_id":"4c588222-a42d-4351-b04c-d24c9f3e7c07","resolution":{"observed_at":"2026-08-04T19:28:32.849254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:32.973420Z","title":"Sharegpt4video: Improving video understanding and generation with better captions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:32.973420Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:281a7499cd9f71c63b11542b67d90fe329321fb503d1d5efba8ba117add38ea1","observation_id":"93b70808-69bd-43bb-b880-3955f547ac61","resolution":{"observed_at":"2026-08-04T19:28:32.973420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:33.032028Z","title":"Dibs: Enhancing dense video captioning with unlabeled videos via pseudo boundary enrichment and online refinement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:33.032028Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:0d5b48e78dcb5f6c1935bddc50d60e04f9a936ea31c2b3869d32fb4e71ad518f","observation_id":"147cd8f3-db37-4d87-995b-fb11bb041f78","resolution":{"observed_at":"2026-08-04T19:28:33.032028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:33.121208Z","title":"Morevqa: Exploring modular reasoning models for video question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:33.121208Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:e637d6c369a8919678b5712d3159f660f80f539803dfdccdea19fee4c02408ab","observation_id":"476d495c-d00b-44d6-919c-42593243e6ca","resolution":{"observed_at":"2026-08-04T19:28:33.121208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-16T14:17:41.002456Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-04T19:28:33.205521Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:33.205521Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:44e8f1b82ea8c84392bcef76f8413456ab179b0f3624dd27d17011a411f89c49","observation_id":"7efcc816-3e85-4a3e-9cc1-8dabf50b7804","resolution":{"observed_at":"2026-08-04T19:28:33.205521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:33.305062Z","title":"Negative sample matters: A renaissance of metric learning for temporal grounding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:33.305062Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:e8d87b4ded6515a28fcf29084b546830bbe7787182a3284fe57540050baff0a7","observation_id":"bb5557a8-9227-45ae-abb6-bc505cfc1a82","resolution":{"observed_at":"2026-08-04T19:28:33.305062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-04T19:28:33.385051Z","title":"Video-llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:33.385051Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:ad2415d676ee9bfeadbeaa63e82983772d5c3d2716ac837c21e948f18ff2ab45","observation_id":"b59b4d2e-d85d-439c-89f8-bb58049600ca","resolution":{"observed_at":"2026-08-04T19:28:33.385051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-04T19:28:33.485739Z","title":"Video instruction tuning with synthetic data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:33.485739Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:2a2cea0081c02cd6586ba3a7afdbd4e2f35ee91ac3f5ba7e25df6b65697d34fb","observation_id":"2a6b7a38-761c-4dc1-80c4-79e67f6e1854","resolution":{"observed_at":"2026-08-04T19:28:33.485739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-04T19:28:33.593857Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:33.593857Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:88674eceb2ab6921ba4de59ce0436c4c1722e69851915df6f2752c1be4743b29","observation_id":"fdb33a5f-58f8-4185-8734-36fbeeb8005a","resolution":{"observed_at":"2026-08-04T19:28:33.593857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-04T19:28:33.688874Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:33.688874Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:cb3a166d8e36c3f0e1edb5c0f213d8e6e768eefea63fcc6eeac4270c9ad35061","observation_id":"98bc26e1-b95b-4169-a7de-4e94406e3e86","resolution":{"observed_at":"2026-08-04T19:28:33.688874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-04T19:28:33.774070Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:33.774070Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:1cc54ed3aed191450654335328aeb7d97e31f0300501f341083dc9a37355188e","observation_id":"b36bf2d3-60fd-49bb-82f2-07bc32b5146b","resolution":{"observed_at":"2026-08-04T19:28:33.774070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:33.879367Z","title":"Longvideobench: A benchmark for long-context interleaved video- language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:33.879367Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:684bdd1a77194cdb39a1dbb1b1d8bd0187e6a67967d404f9c718ad73a3ef797e","observation_id":"6b128814-feca-4e5a-bb51-019d44bc8eb8","resolution":{"observed_at":"2026-08-04T19:28:33.879367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-04T19:28:33.960072Z","title":"Lvbench: An extreme long video understanding benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:33.960072Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:2d46d49733996f60321b708c5fcd90e9b86809a7408d64da7115e8c96504dd20","observation_id":"69d74be3-8a17-49e7-b34e-6e81746dc78f","resolution":{"observed_at":"2026-08-04T19:28:33.960072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12963","last_updated":"2024-10-02T01:56:08Z","snapshot_observed_at":"2026-08-16T13:17:05.225628Z","submitted_at":"2024-09-19T17:59:55Z","title":"Interpolating Video-LLMs: Toward Longer-sequence LMMs in a Training-free Manner","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12963","snapshot_observed_at":"2026-08-04T19:28:34.040878Z","title":"Interpolating video-llms: Toward longer-sequence lmms in a training-free manner,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.040878Z"},"links":{"cited_paper":"/paper/2409.12963","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:2369f1260114619fd62368cd355aa898d2e49ffd9835aec75eba3e0730f0d1e4","observation_id":"feb1c0be-5028-459b-94a2-88cc60b01236","resolution":{"observed_at":"2026-08-04T19:28:34.040878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-04T19:28:34.150112Z","title":"Long context transfer from language to vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.150112Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:05aeadd84efda622986ddbc0b50cda502ab78e42ff760694b645703c7bb6a302","observation_id":"a75667df-189b-40d5-a2e7-ab369304ba27","resolution":{"observed_at":"2026-08-04T19:28:34.150112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20018","last_updated":"2024-10-02T09:34:11Z","snapshot_observed_at":"2026-08-20T06:29:45.078579Z","submitted_at":"2024-09-30T07:25:16Z","title":"Visual Context Window Extension: A New Perspective for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20018","snapshot_observed_at":"2026-08-04T19:28:34.247158Z","title":"Visual context window extension: A new perspective for long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.247158Z"},"links":{"cited_paper":"/paper/2409.20018","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:110a6a7eeea4889228c9a96308413a3e0fbcdd9aaf9379c9b21d8986d856a23a","observation_id":"22e1696a-3703-4675-9506-ef2c6cae2c87","resolution":{"observed_at":"2026-08-04T19:28:34.247158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-16T04:27:36.181491Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-04T19:28:34.352539Z","title":"Longvila: Scaling long-context visual language models for long videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.352539Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:d33f112c5c9ca9abce5bbad61995f27fee734fd6263e970963d6e2a5339a69c8","observation_id":"efb52306-5104-48a7-aef7-4735da755979","resolution":{"observed_at":"2026-08-04T19:28:34.352539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12559","last_updated":"2025-06-08T05:57:12Z","snapshot_observed_at":"2026-08-20T16:32:04.413903Z","submitted_at":"2025-03-16T16:14:52Z","title":"AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12559","snapshot_observed_at":"2026-08-04T19:28:34.417628Z","title":"Adaretake: Adaptive redundancy reduction to perceive longer for video-language understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.417628Z"},"links":{"cited_paper":"/paper/2503.12559","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:9e8f5ba7a3641632b3b6d1663a3e519354f26c1892c2a3289c8d6b96e939cd9a","observation_id":"c2c22972-8ae0-4bfd-8dab-8065d9bb208b","resolution":{"observed_at":"2026-08-04T19:28:34.417628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06299","last_updated":"2024-09-10T07:53:10Z","snapshot_observed_at":"2026-08-19T17:55:27.127889Z","submitted_at":"2024-09-10T07:53:10Z","title":"Enhancing Long Video Understanding via Hierarchical Event-Based Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06299","snapshot_observed_at":"2026-08-04T19:28:34.513278Z","title":"Enhancing long video understanding via hierarchical event-based memory,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.513278Z"},"links":{"cited_paper":"/paper/2409.06299","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:e1b59672e0449d1c7ed4fc6003e04872febed1b6878841bae4a0f676f883aac8","observation_id":"bdb74b2a-7170-4308-8f2e-da0a092a7ddb","resolution":{"observed_at":"2026-08-04T19:28:34.513278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08584","last_updated":"2024-12-18T07:45:11Z","snapshot_observed_at":"2026-08-16T13:10:26.290770Z","submitted_at":"2024-10-11T07:24:21Z","title":"ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08584","snapshot_observed_at":"2026-08-04T19:28:34.591425Z","title":"Zipvl: Efficient large vision-language models with dynamic token sparsification and kv cache compression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.591425Z"},"links":{"cited_paper":"/paper/2410.08584","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:4c9a8042b47780a739d77529b43df766eecca5f1d413b57ed0d01496ffe5c7ea","observation_id":"a2c89837-b407-4cab-898d-d6e0d3c2c885","resolution":{"observed_at":"2026-08-04T19:28:34.591425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:34.696017Z","title":"Ma-lmm: Memory- augmented large multimodal model for long-term video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.696017Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:5e04377170931aadd8d964aa217d6bd1425f5a859baac4289bf92538165b2fbe","observation_id":"c73f5009-f744-476c-ad1e-6f9c6992c300","resolution":{"observed_at":"2026-08-04T19:28:34.696017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-08-15T16:39:44.454451Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-08-04T19:28:34.762522Z","title":"Timemarker: A versatile video-llm for long and short video understanding with superior temporal localization ability,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.762522Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:f1abd542729f9999ec1f6ca43ac446b72337c8233f00b2aaba9ce80a1bc491c1","observation_id":"3b556654-4211-4f6f-b6dd-fc0ec69fb8fd","resolution":{"observed_at":"2026-08-04T19:28:34.762522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:34.870488Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.870488Z"},"links":{"citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:d850878c31b8c153022d7fa099c389f57937273d01855b34f0216e63d31247a8","observation_id":"fd14bf21-e9ae-4f60-9646-65fb995f1861","resolution":{"observed_at":"2026-08-04T19:28:34.870488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-04T19:28:34.963515Z","title":"Qwen2. 5-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.963515Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:731ed37076dd3c40b498a423f7b4c47a71d218ad05ba152f1ef788d040f374fa","observation_id":"0ec38891-e23f-4f47-a80a-d702265396f9","resolution":{"observed_at":"2026-08-04T19:28:34.963515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T19:28:35.059185Z","title":"Llava- onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:35.059185Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:ba3c6f61ed09a508bb3a984fa7f2cadeec0ea43fca12682bd2abbbb963fc85f8","observation_id":"9800e012-7f9c-4229-b3cf-744921626fca","resolution":{"observed_at":"2026-08-04T19:28:35.059185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21483","last_updated":"2025-03-27T13:18:40Z","snapshot_observed_at":"2026-08-20T06:33:12.263428Z","submitted_at":"2025-03-27T13:18:40Z","title":"BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21483","snapshot_observed_at":"2026-08-04T19:28:35.159055Z","title":"Bolt: Boost large vision-language model without training for long-form video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:35.159055Z"},"links":{"cited_paper":"/paper/2503.21483","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:68bd1b2a41fe8ebdd399c9980060568d7b04c78bbc3ecf0e87e8581b666ef050","observation_id":"65c7535d-2b92-4fda-8351-eed921ad8a2a","resolution":{"observed_at":"2026-08-04T19:28:35.159055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T19:28:35.241017Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:35.241017Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:48f4c482437a05e467627e4675e8641298c584771cf9fb31a0ac366a0420b5f9","observation_id":"04b4fa8c-bc72-4680-8df4-4e81a2d28cd1","resolution":{"observed_at":"2026-08-04T19:28:35.241017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T19:46:35.973969Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2509.09263."}