{"as_of":"2026-08-06T03:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01998064f9dcb5e02eb68e6f01bfcefa30c8eadfc68fadbf3fcfd0a56c9ef95f","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:17:00.737308Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24794/citation-record","integrity":"/paper/2607.24794/integrity","json":"/paper/2607.24794/citation-record.json","paper":"/paper/2607.24794"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T09:17:00.511770Z","title":"arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.511770Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:cf3e6d0c541f7be00d27eca7668dd30040d5392fd113b24dbdb6dd1dbd85e7a9","observation_id":"dd941821-f874-47fa-8758-d848d3508629","resolution":{"observed_at":"2026-08-02T09:17:00.511770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-02T09:17:00.517189Z","title":"arXiv preprint arXiv:2309.16609 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.517189Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:b4e67680c12cda60c25084a5228d0134d522188a71542535c7619a7fe0e0bf71","observation_id":"3702b85a-3ff4-45cf-ad4e-31467d370a68","resolution":{"observed_at":"2026-08-02T09:17:00.517189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T09:17:00.521832Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.521832Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:a5aacd79ab2a76044c176d1194b9c42cef14e1e8a50177f82fa3acb891be7c5b","observation_id":"0f5e1090-2901-4d84-9afe-2204d8ac621b","resolution":{"observed_at":"2026-08-02T09:17:00.521832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.526512Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.526512Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:52c6e631280666b69a4408a59c5898a938428d62f8a30cb8d01bbcbdeb6f5e91","observation_id":"25b417d5-9d0f-41c0-86f0-6f0a8c420374","resolution":{"observed_at":"2026-08-02T09:17:00.526512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-02T09:17:00.531111Z","title":"arXiv preprint arXiv:2408.10188 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.531111Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:f458068a58d238e3e82f98f0a6b01cab0aaad8a202828071be014a14ae088e6c","observation_id":"5a34c98e-320c-4300-afb0-5367261abcf7","resolution":{"observed_at":"2026-08-02T09:17:00.531111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-02T09:17:00.535888Z","title":"arXiv preprint arXiv:2406.07476 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.535888Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:58b0b57a87ed618b50f93e61f7732cf033a5556a9b2f373bbc046596376aef17","observation_id":"e1b0a4c3-f277-44ef-ba68-be387ed96902","resolution":{"observed_at":"2026-08-02T09:17:00.535888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-05T18:56:00.240992Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-02T09:17:00.541193Z","title":"arXiv preprint arXiv:2408.14023 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.541193Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:2573c33f0440c70ebe87f26a473fa5a770f4623a0288ff42c5044ef7554d4f08","observation_id":"dc306c73-3c39-4073-9433-30caa848ad63","resolution":{"observed_at":"2026-08-02T09:17:00.541193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-02T09:17:00.545933Z","title":"arXiv preprint arXiv:2503.21776 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.545933Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:2d71ccde2fd392f4460dc89c2a5562e5b7261d20385764f0126ed108a682d0e1","observation_id":"9a02c0d5-09b6-480c-a3a6-e90709dc5a4b","resolution":{"observed_at":"2026-08-02T09:17:00.545933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.550665Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.550665Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:c04bea3e34d5a1127b2f13092cea75dae41efabd79e019af1b11204ceb3a4f76","observation_id":"b5f61625-4413-409f-a8c3-4683fcebf3ab","resolution":{"observed_at":"2026-08-02T09:17:00.550665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00318","last_updated":"2026-04-04T04:38:43Z","snapshot_observed_at":"2026-07-06T21:34:05.672636Z","submitted_at":"2025-05-31T00:08:21Z","title":"Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00318","snapshot_observed_at":"2026-08-02T09:17:00.555120Z","title":"arXiv preprint arXiv:2506.00318 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.555120Z"},"links":{"cited_paper":"/paper/2506.00318","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:8a0a53980c7c9cb121379fb7499d94d6d1132fe0a198b54a362f108b4b66f836","observation_id":"c22ef1de-d33b-49c5-906b-df1904f42806","resolution":{"observed_at":"2026-08-02T09:17:00.555120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13139","last_updated":"2025-05-17T13:22:07Z","snapshot_observed_at":"2026-07-06T20:53:55.745087Z","submitted_at":"2025-03-17T13:07:34Z","title":"Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13139","snapshot_observed_at":"2026-08-02T09:17:00.559451Z","title":"arXiv preprint arXiv:2503.13139 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.559451Z"},"links":{"cited_paper":"/paper/2503.13139","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:64f42f9f17b5436514ace265621d91c515492d741cd7574421530eb463c16d9d","observation_id":"a796e40a-ee10-4eb1-af32-b4a4795cdba3","resolution":{"observed_at":"2026-08-02T09:17:00.559451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.563761Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.563761Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:7b56540f2a10bcc3333ab7b4adfc51b192f4ca3950ba47e7c0209e69bbf51aa9","observation_id":"df6da93b-70ec-4f72-858b-59ce13b20e71","resolution":{"observed_at":"2026-08-02T09:17:00.563761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.568152Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.568152Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:e031a48d2bfbdbc977aa74ba563bf26f18dffc112e20bdcbcccfff75195a7744","observation_id":"38a3a8bf-2192-4e50-b778-c683a142f001","resolution":{"observed_at":"2026-08-02T09:17:00.568152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-02T09:17:00.572148Z","title":"arXiv preprint arXiv:2408.03326 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.572148Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:97e12e57ca1a11b84084dc89fc2b35d2aa330516b4ca957ec480ca9d3e7a2e62","observation_id":"ae9ef788-38f6-44b3-9c96-f45ba69783af","resolution":{"observed_at":"2026-08-02T09:17:00.572148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.576690Z","title":"arXiv preprint arXiv:2510.03584 (2025) Reasoning with Memory 17","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.576690Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:be7debbccbf93760b295f4d5fefbe2af2fd4349b44e5df785c36d2eca1408cf6","observation_id":"b54f417b-8d24-4a2d-997d-4eb6621c4b3a","resolution":{"observed_at":"2026-08-02T09:17:00.576690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.580657Z","title":"Science China Information Sciences 68(10), 200102 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.580657Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:b21732b1ba50d78505b961b2ab2aca6c8c58d291e1524b96f70452f59f95f12f","observation_id":"1f60e15d-e7c8-4f34-9ddd-f1df110be1dd","resolution":{"observed_at":"2026-08-02T09:17:00.580657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.584587Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.584587Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:24f2c2ae2550c7e82f574311e607e3caec0b32d5d23c63956d2fc78c0bdf1bec","observation_id":"21122611-aee7-4c28-80ad-03c6708540dd","resolution":{"observed_at":"2026-08-02T09:17:00.584587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-02T09:17:00.588877Z","title":"arXiv preprint arXiv:2504.06958 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.588877Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:42de1eb1ff30a41267701cd4c4fc908a68823d8771e991f53000b95a19cc7553","observation_id":"891a9b18-05ab-45ab-af4f-eed5eb545fd2","resolution":{"observed_at":"2026-08-02T09:17:00.588877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.593113Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.593113Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:7e361ca897b913fd7108dcf0e54907d113408ca770953240f70b45ac6a899265","observation_id":"f9b2cd4c-6aeb-48db-aeea-95f672688674","resolution":{"observed_at":"2026-08-02T09:17:00.593113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03104","last_updated":"2024-08-10T14:57:37Z","snapshot_observed_at":"2026-07-06T18:40:57.362549Z","submitted_at":"2024-07-03T13:41:44Z","title":"KeyVideoLLM: Towards Large-scale Video Keyframe Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03104","snapshot_observed_at":"2026-08-02T09:17:00.597095Z","title":"arXiv preprint arXiv:2407.03104 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.597095Z"},"links":{"cited_paper":"/paper/2407.03104","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:97c6ee3f5fa6464154c6be0f594b3b781f55a5dd15c198c81637ce9b1eaa0c9b","observation_id":"278fde52-fa8a-4fbb-9267-5625a466fbdc","resolution":{"observed_at":"2026-08-02T09:17:00.597095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.601522Z","title":"In: Proceedings of the 2024 conference on empirical methods in natural language processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.601522Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:d553e8edee14a4399d52108c29d1b533986351348b79c61307135d51526a9bbd","observation_id":"f87ee396-003f-4ce2-967d-114cdb3439f3","resolution":{"observed_at":"2026-08-02T09:17:00.601522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.605388Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.605388Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:39deb5c0cc1877e10602d06f8ff3ebfe5195d207722424a4d29c899b8a4b2666","observation_id":"e23e734b-6cde-40a8-b9a1-7974ab58d4f2","resolution":{"observed_at":"2026-08-02T09:17:00.605388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.610079Z","title":"Advances in neural information processing systems36, 34892–34916 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.610079Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:dcfe12aff091643a9a5cc7e119697b989ad2a774e682b0d4a2fd5109dadddaa4","observation_id":"8012af7b-d450-4efd-a6de-9b0071290a13","resolution":{"observed_at":"2026-08-02T09:17:00.610079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.614365Z","title":"In: Proceedings of the Com- puter Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.614365Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:692b8d371beaf9a6e86a729b9a7b3c0b7f7d8c7f46fa088617120cfbd44ffce6","observation_id":"5a0ec5ec-d4d0-44df-871e-0fdd7b9e24ff","resolution":{"observed_at":"2026-08-02T09:17:00.614365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.618532Z","title":"In: Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.618532Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:71a71afa37bcc3ad177b92c0ef54a37b06f9c5506e15a9bfc251da8b59971f34","observation_id":"fb45bd07-9f53-4cf7-9500-88f2466d8bf3","resolution":{"observed_at":"2026-08-02T09:17:00.618532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.622552Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.622552Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:61db1934d933a6fea41df82255d5f8b73998abe17e8ea51d925edc48e686ce35","observation_id":"936f58dc-ef05-49c1-86ae-200f05c46ed4","resolution":{"observed_at":"2026-08-02T09:17:00.622552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.626887Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.626887Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:d6cb684c33caf50c37e1445584c2152e288235a47310c726ae8d100c4c971f18","observation_id":"a80618cb-d6d4-4db7-86bf-fac6c477f7d6","resolution":{"observed_at":"2026-08-02T09:17:00.626887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-02T09:17:00.631346Z","title":"arXiv preprint arXiv:2410.17434 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.631346Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:9a960cc7f869bf84192db8b3d887634ff5f6d2363afcfae034211cfead3b0704","observation_id":"ebbdd6a3-4465-4499-b6f6-768c990ad258","resolution":{"observed_at":"2026-08-02T09:17:00.631346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.636045Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.636045Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:d8c86e2e817feefebf82a651746d20ac92b9b14d1e4a0060bcc813dcd382740f","observation_id":"7c30e099-1d52-4083-b886-0ff6dabcea15","resolution":{"observed_at":"2026-08-02T09:17:00.636045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.640021Z","title":"arXiv preprint arXiv:2602.03615 (2026) 18 L","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.640021Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:107faf765bbaa7414c18b148131060533c4c42bb87bb61e90c1e82071117df08","observation_id":"d290d559-03e9-4b80-ad9b-0fce13ecb049","resolution":{"observed_at":"2026-08-02T09:17:00.640021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.643859Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.643859Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:ea1a1b5ab0ae44c7b5e3c30771ce9d8b1bc178db5f2b3744870350ab4782ee33","observation_id":"924c7e14-e153-47a4-83e2-10a092f54d30","resolution":{"observed_at":"2026-08-02T09:17:00.643859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.648083Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.648083Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:d4a77786aa9fb7c09adb2f399966010a05a1f04e4b24e5ec9621e2e2000a43b2","observation_id":"c6714c93-efa6-4f52-bc99-28f71d33161b","resolution":{"observed_at":"2026-08-02T09:17:00.648083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.652476Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.652476Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:f78d58283e40874b28ec66e1b85c87f36d3106d40459efe86692173d919f03ab","observation_id":"64faf436-0acf-4c55-a8cb-0c9e780ad3db","resolution":{"observed_at":"2026-08-02T09:17:00.652476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T09:17:00.656581Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.656581Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:0a1888082a17038239070662aa05800d06f4ebe208e9f82a11e2afcd31269e82","observation_id":"bbcd10d5-c6b3-4b3e-a113-b2241926d37f","resolution":{"observed_at":"2026-08-02T09:17:00.656581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.660669Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.660669Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:a74e64120e3f98248682acf024374b30f5c5cd8209084a2eba02e533b0a717db","observation_id":"0a3649d5-a1b2-4f7b-9cce-1b1318875ba4","resolution":{"observed_at":"2026-08-02T09:17:00.660669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-02T09:17:00.664674Z","title":"arXiv preprint arXiv:2307.06942 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.664674Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:ac8d6c7e4be0b445101a4e6a4c30d447dcd37a0a37b2b2c750c6060999c54c01","observation_id":"90122d2e-2650-4361-8e45-90c25df1d96c","resolution":{"observed_at":"2026-08-02T09:17:00.664674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.669349Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.669349Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:884ed81a637c7724277d4e81834275d55c6d262807daf08e6288a1662607b7c2","observation_id":"fb65a3fd-5c7a-48cf-a620-210305680f44","resolution":{"observed_at":"2026-08-02T09:17:00.669349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.673498Z","title":"Advances in Neural Information Pro- cessing Systems37, 28828–28857 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.673498Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:79b53a7729303b60ff0b48d733f6ab6b96cd92224f86cd6c2773f8f77a621482","observation_id":"0b6e3ec4-8908-4f24-9db3-ea2c591a1004","resolution":{"observed_at":"2026-08-02T09:17:00.673498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.677992Z","title":"In: Findings of the Association for Computational Linguistics: ACL 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.677992Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:135dfc6f128e041d35d3abfe6205a1a6f8d7d91403612e4211301bc19dc6c61c","observation_id":"4e83fd94-5cfb-4513-98d9-bf647f857d96","resolution":{"observed_at":"2026-08-02T09:17:00.677992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.682138Z","title":"Advances in Neural Information Processing Systems36, 76749–76771 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.682138Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:272481ed16eb259bda16691cc88ac87ef23cb015ce5a22baa4e18b3131655e39","observation_id":"3fad15c3-8c26-464f-8808-6a842a0f5a06","resolution":{"observed_at":"2026-08-02T09:17:00.682138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-02T09:17:00.686105Z","title":"arXiv preprint arXiv:2410.03226 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.686105Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:592c63f084a11986c9f4457b87dd55d3da48eeed771f1cdeed941367c2d271a9","observation_id":"4d60bb00-203a-46b2-aa67-6539123e0776","resolution":{"observed_at":"2026-08-02T09:17:00.686105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-02T09:17:00.690611Z","title":"arXiv preprint arXiv:2501.13106 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.690611Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:0d54026324e4ca0d6ebbb37aa3111a8338786eca4aa989f6bda2e3ddbc1da84d","observation_id":"8c8c2ba3-bc9a-4eda-93a8-2ce2da7a1379","resolution":{"observed_at":"2026-08-02T09:17:00.690611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.694766Z","title":"In: Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.694766Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:263bdb0f79f3df30ec568809728661eefa791f2c9f5106076b1ad66ff52fff03","observation_id":"c2b16969-4749-48d9-bf38-8948feb82bca","resolution":{"observed_at":"2026-08-02T09:17:00.694766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.698642Z","title":"IEEE Transactions on Infor- mation Forensics and Security (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.698642Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:daf47026e5961a6c568f1caea213c7fc35c2aa4ccc089bd1b02875f9482a7e45","observation_id":"7a9ea81b-99a8-482f-bd1e-92de0edb5a43","resolution":{"observed_at":"2026-08-02T09:17:00.698642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.702872Z","title":"IEEE Transactions on Circuits and Systems for Video Technology (2026) Reasoning with Memory 19","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.702872Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:871acadd8ebad7b2237886b78f4ee58ecd3e04c70a3c5e62bf7d406e77ba5b40","observation_id":"1c0548e8-5ea2-4857-b148-23cdcbebae8a","resolution":{"observed_at":"2026-08-02T09:17:00.702872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-02T09:17:00.707071Z","title":"arXiv preprint arXiv:2406.16852 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.707071Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:42a6d5e0666c363e20d37d2c534219ba8f9cd402dfd77d8dd16aa28e0aeaa545","observation_id":"0fdc82a5-17ce-4623-ade5-544822d51adb","resolution":{"observed_at":"2026-08-02T09:17:00.707071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.711545Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.711545Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:127f1da2a5dd016c9802ea413433f45d435a7e7973ff356431a1232545fa2f3a","observation_id":"8ef9301f-8e8f-4ebc-8c5f-1649636531a1","resolution":{"observed_at":"2026-08-02T09:17:00.711545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-02T09:17:00.715720Z","title":"arXiv preprint arXiv:2410.02713 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.715720Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:c280f1e7a6cb30af236ea6d1b3ff137c6d20d30dcafff29ce9afc5842e33bbfc","observation_id":"aa73e4af-e569-40f7-9688-2695e30b8fe6","resolution":{"observed_at":"2026-08-02T09:17:00.715720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-07-06T21:34:34.091508Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00993","snapshot_observed_at":"2026-08-02T09:17:00.719844Z","title":"arXiv preprint arXiv:2506.00993 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.719844Z"},"links":{"cited_paper":"/paper/2506.00993","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:1881dd5f6447ec93b7bf52b33c8d1c9afc717129c9722e0fecaba44112a93720","observation_id":"fd526ce5-1a3b-4b14-91b0-56a7c9883c5e","resolution":{"observed_at":"2026-08-02T09:17:00.719844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.724424Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.724424Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:2b0b51c1e146d4909a951989be785b2a125f85913b023208ea825a28d796b989","observation_id":"280810e7-17d9-4b8f-9821-3eb32dab6f07","resolution":{"observed_at":"2026-08-02T09:17:00.724424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-02T09:17:00.728552Z","title":"arXiv preprint arXiv:2406.042642(5), 6 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.728552Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:892e5a67227b4aa5e6cb64d7485ab6bd9581a69c4753d7f4ee42622cda596049","observation_id":"a07ed3a8-269f-49f8-9bad-65d2a499ca02","resolution":{"observed_at":"2026-08-02T09:17:00.728552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-02T09:17:00.732914Z","title":"arXiv preprint arXiv:2304.10592 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.732914Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:d4daae7a1b2aceeb066e8912775d260910d504621396d8b22fed8dcf4a73ff60","observation_id":"2f4cd03a-619f-41af-a88e-4c2672ad628d","resolution":{"observed_at":"2026-08-02T09:17:00.732914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.737308Z","title":"arXiv preprint arXiv:2510.27280 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.737308Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:ade62d4a105a3b80b27976bc5ba52d173859d1e972ad050c893e3845c7d55b61","observation_id":"42bcc785-5ecd-4532-8f17-42fb56a35ea7","resolution":{"observed_at":"2026-08-02T09:17:00.737308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-04T15:39:40.613332Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2607.24794."}