{"as_of":"2026-08-08T23:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c541695c4914861a180234180578a31d5537bb722a149df49673612ca8f6234b","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:35:51.010785Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:15:02.124035Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T20:06:13.270265Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07600","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scenerag: Scene-level retrieval- augmented generation for video understanding","venue":null,"work_id":"05106e58-90f8-4ad2-8d0c-f8e91bad34e9","year":2025},"citing_paper":{"arxiv_id":"2604.05418","last_updated":"2026-04-16T09:51:53Z","snapshot_observed_at":"2026-08-03T01:38:19.340462Z","submitted_at":"2026-04-07T04:26:59Z","title":"VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T19:15:02.124035Z"},"links":{"cited_paper":"/paper/2506.07600","citing_paper":"/paper/2604.05418"},"observation_digest":"sha256:37e4c56f985e61beefefa8729aeee2cb05ed57bf35b8f034dc46e1956431b575","observation_id":"421e6316-0ac4-469d-b56b-9ab6d9809818","resolution":{"observed_at":"2026-05-10T23:15:50.244866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07600","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scenerag: Scene-level retrieval- augmented generation for video understanding","venue":null,"work_id":"05106e58-90f8-4ad2-8d0c-f8e91bad34e9","year":2025},"citing_paper":{"arxiv_id":"2605.06185","last_updated":"2026-05-07T13:01:28Z","snapshot_observed_at":"2026-07-31T08:26:58.598336Z","submitted_at":"2026-05-07T13:01:28Z","title":"Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T10:15:15.129358Z"},"links":{"cited_paper":"/paper/2506.07600","citing_paper":"/paper/2605.06185"},"observation_digest":"sha256:95c69603d64f7dd40e71f8daa064893ce0ee7cad782898cfe9215e49676a0046","observation_id":"47a983ba-dc27-4128-a3a7-eec95b5f3594","resolution":{"observed_at":"2026-05-11T20:06:13.272901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07600/citation-record","integrity":"/paper/2506.07600/integrity","json":"/paper/2506.07600/citation-record.json","paper":"/paper/2506.07600"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-07T23:30:50.787767Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-08-07T05:35:50.716342Z","title":"Ask in any modality: A comprehensive survey on multimodal retrieval-augmented generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.716342Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:0450f821248ab07dfce24907e546573d0fcb2c891f53642ca3ab19080793e565","observation_id":"0f78863e-e058-499f-8271-8b3df8218a37","resolution":{"observed_at":"2026-08-07T05:35:50.716342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.722098Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35: 23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.722098Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:6bbf5e070af3d00937502c377bdc759f59ec21ca8ba4936903d0877c789002c3","observation_id":"b63a5283-71c9-45e2-a079-fc9ef20f04ec","resolution":{"observed_at":"2026-08-07T05:35:50.722098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.726908Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.726908Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:fd6d7a111a0f65f5723ce990a8b65b4d18a1d1f8232a2e8c02815fbf09080d14","observation_id":"2b4c3222-d80a-40e0-9ff5-6713bb3c1325","resolution":{"observed_at":"2026-08-07T05:35:50.726908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:52.093288Z","title":"Unified graph structured models for video understanding","venue":null,"work_id":"95efacfb-fcd7-4159-b70c-fb23b48e2a35","year":2021},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.732034Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:9c90cb5f9bd35e07fa12ab8a8f8e6a587d29a7c375b97d90323cec6df6cde541","observation_id":"4049a5bd-46e6-4991-a9e3-2b1c5d84afce","resolution":{"observed_at":"2026-08-07T05:35:52.098046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.736730Z","title":"Self-rag: Learning to retrieve, generate, and critique through self-reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.736730Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:f8127d90d1a957e6f889693b61cb125c0f4d4b6d839e552a7e728fd5d6f2803c","observation_id":"b3c25b8a-437b-4dc0-9001-eca88c2a9f25","resolution":{"observed_at":"2026-08-07T05:35:50.736730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:52.064872Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.Advances in Neural Information Processing Systems, 37:19472–19495, 2024","venue":null,"work_id":"076ce1a5-60db-4cd1-9965-99354ff06375","year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.741138Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:d2d0a257afc158c9b6484be42059134d96c18a760c745563f4daa21bfe4274f0","observation_id":"4aa681f7-bfa0-43cc-9892-b054964886a7","resolution":{"observed_at":"2026-08-07T05:35:52.070182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14727","last_updated":"2025-02-20T16:54:07Z","snapshot_observed_at":"2026-08-07T18:01:26.190847Z","submitted_at":"2025-02-20T16:54:07Z","title":"WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14727","snapshot_observed_at":"2026-08-07T05:35:50.746422Z","title":"Wavrag: Audio-integrated retrieval augmented generation for spoken dialogue models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.746422Z"},"links":{"cited_paper":"/paper/2502.14727","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:834f2882fd6d96c7a0aa6bcba473fb3e89fd87affcdf9b4d0286df375d8f7eb2","observation_id":"d0bd1e4f-7665-4a89-852b-f07dce6a7fa9","resolution":{"observed_at":"2026-08-07T05:35:50.746422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T05:35:50.751331Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.751331Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:6aeee5ed8f83fa7ad503f40e64c734242d702a53fcab18bcb41b1b9c1b2bf5b6","observation_id":"787bbd23-4312-46c8-a59a-1bdd76534d1b","resolution":{"observed_at":"2026-08-07T05:35:50.751331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:52.046844Z","title":null,"venue":null,"work_id":"5d1e83d2-c0d4-4a46-991e-129c19f2787d","year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.756117Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:53bca441a0fac1d87297ff08553fbf31635a8eb206f1552f38baec84f3c08b75","observation_id":"1d00498a-0c60-4167-9e19-2234800adfc9","resolution":{"observed_at":"2026-08-07T05:35:52.052581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:52.028482Z","title":"Sscformer: Push the limit of chunk-wise conformer for streaming asr using sequentially sampled chunks and chunked causal convolution","venue":null,"work_id":"b0c72c4f-ecc8-4874-a129-899534afcde6","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.762345Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:e1fabc8a2b53aa8268bd620b0c41a209cba827234a6b9f880d289b8a0f9d3e4e","observation_id":"a5ce122e-a137-4c49-a7ca-877690d956bb","resolution":{"observed_at":"2026-08-07T05:35:52.034449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:52.012340Z","title":"Event segmentation and seven types of narrative discontinuity in popular movies.Acta psychologica, 149:69–77, 2014","venue":null,"work_id":"f483848f-f51d-4bc2-9197-d628c5b283be","year":2014},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.766627Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:c5c7ca173495f00e9f474506cb7302b102e4638e3aa9398885004c41d2b73448","observation_id":"353333cb-08da-4433-80ec-c3f2e8d06b12","resolution":{"observed_at":"2026-08-07T05:35:52.017494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.996257Z","title":"Large-scale narrative events in popular cinema","venue":null,"work_id":"09d8a62a-0c75-441e-ac96-f932951dac0c","year":2019},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.770754Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:836c9fbf27a14c7fcf8da901656b6023f96c2910e4ac0c80219a2d5c411d52f0","observation_id":"53b133fe-8f81-4f76-ac9a-d7e0e3ebc3b4","resolution":{"observed_at":"2026-08-07T05:35:52.000990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16130","last_updated":"2025-02-19T10:49:41Z","snapshot_observed_at":"2026-07-06T18:05:11.700127Z","submitted_at":"2024-04-24T18:38:11Z","title":"From Local to Global: A Graph RAG Approach to Query-Focused Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16130","snapshot_observed_at":"2026-08-07T05:35:50.775173Z","title":"From local to global: A graph rag approach to query-focused summarization.arXiv preprint arXiv:2404.16130, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.775173Z"},"links":{"cited_paper":"/paper/2404.16130","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:1691e825cf3bd8cd63c25d27acc2038876f2057890aad9668a7e45ffc27a0070","observation_id":"42d938a9-4bf6-435d-ad1f-ca8e98c3aa5d","resolution":{"observed_at":"2026-08-07T05:35:50.775173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.980625Z","title":"Videoagent: A memory-augmented multimodal agent for video understanding","venue":null,"work_id":"063491d9-d889-4994-963a-d250ac80f6b7","year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.779943Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:d7db4a082740950d42c9d13b199e19484e64a27b9b589bf7335d73d516b0ef54","observation_id":"16cffcf3-1e1b-45a6-83ef-a3abc8e033f4","resolution":{"observed_at":"2026-08-07T05:35:51.985406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00430","last_updated":"2023-11-01T10:45:07Z","snapshot_observed_at":"2026-08-08T04:51:03.844048Z","submitted_at":"2023-11-01T10:45:07Z","title":"Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00430","snapshot_observed_at":"2026-08-07T05:35:50.784040Z","title":"Distil-whisper: Robust knowledge distillation via large-scale pseudo labelling.arXiv preprint arXiv:2311.00430, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.784040Z"},"links":{"cited_paper":"/paper/2311.00430","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:8b2d115d62df17759214dd0027eb44bc188618e60f769c79e2e95d81f6ee9dc8","observation_id":"2616490e-330d-4164-ad63-ef68cacedb31","resolution":{"observed_at":"2026-08-07T05:35:50.784040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-07T05:35:50.788520Z","title":"Retrieval-augmented generation for large language models: A survey.arXiv preprint arXiv:2312.10997, 2:1, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.788520Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:b5dcbb903b0e432d970a672d7da82f6e0944179200cc98c6011f53bb7720d580","observation_id":"c1cab8fa-f191-40aa-9038-3dd0efdbfaf9","resolution":{"observed_at":"2026-08-07T05:35:50.788520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.793225Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.793225Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:e2b2462a29281c144b079c10f7b60e8818f40c36ec4df0d022517f4b54554e3e","observation_id":"de8acc01-3b82-452f-92dd-3ba6f04c347f","resolution":{"observed_at":"2026-08-07T05:35:50.793225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.797523Z","title":"Lightrag: Simple and fast retrieval-augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.797523Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:1154abd5299ad3633a7a03c51b56eaff653126240a42e695e2aad7bd6ff7cb89","observation_id":"1c4d502e-b1bd-405a-8c0c-27d89342ab2e","resolution":{"observed_at":"2026-08-07T05:35:50.797523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05874","last_updated":"2025-05-28T18:14:55Z","snapshot_observed_at":"2026-08-06T20:37:11.586885Z","submitted_at":"2025-01-10T11:17:15Z","title":"VideoRAG: Retrieval-Augmented Generation over Video Corpus","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05874","snapshot_observed_at":"2026-08-07T05:35:50.801689Z","title":"Videorag: Retrieval- augmented generation over video corpus.arXiv preprint arXiv:2501.05874, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.801689Z"},"links":{"cited_paper":"/paper/2501.05874","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:8c7e0ee5df30f69da4d0477ddd191794977d86b66494eecbb18aa7be7ca57098","observation_id":"8590ccea-a560-4f54-a566-bd67cde45dde","resolution":{"observed_at":"2026-08-07T05:35:50.801689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.943192Z","title":"Learning temporal video procedure segmentation from an automatically collected large dataset","venue":null,"work_id":"39cdf2ff-947f-4c8b-aba7-7671eb318df4","year":2022},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.806583Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:38b0efad5b903db644ba5077dd53dc01a89f868b7bf2e9b91865ebf9127b72f8","observation_id":"5fa4fc56-0f84-4871-994c-fa8357254b9c","resolution":{"observed_at":"2026-08-07T05:35:51.948243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.927058Z","title":"Diffusionret: Generative text-video retrieval with diffusion model","venue":null,"work_id":"280d2143-6fb4-4c11-8d95-ececd2b4a447","year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.810986Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:2f900c688ae841d37344619b6e60a7909fa10c862182db5c3d9d638fe416485f","observation_id":"3c713945-46a5-408d-acb2-a0ecf0d7a903","resolution":{"observed_at":"2026-08-07T05:35:51.932126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12648","last_updated":"2024-05-21T09:56:48Z","snapshot_observed_at":"2026-07-06T18:17:12.404441Z","submitted_at":"2024-05-21T09:56:48Z","title":"Scene Graph Generation Strategy with Co-occurrence Knowledge and Learnable Term Frequency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12648","snapshot_observed_at":"2026-08-07T05:35:50.815034Z","title":"Scene graph generation strategy with co-occurrence knowledge and learnable term frequency.arXiv preprint arXiv:2405.12648, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.815034Z"},"links":{"cited_paper":"/paper/2405.12648","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:3d097504caebd0edaac97c4efe024072b051f68fa8c8bbe3b6c7bd98333e1d0e","observation_id":"ed6b7bfa-2166-4a9b-93b6-5f8e8ff72f6e","resolution":{"observed_at":"2026-08-07T05:35:50.815034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02030","last_updated":"2024-06-05T03:28:01Z","snapshot_observed_at":"2026-08-06T04:48:58.920073Z","submitted_at":"2024-06-04T07:13:23Z","title":"Multimodal Reasoning with Multimodal Knowledge Graph","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02030","snapshot_observed_at":"2026-08-07T05:35:50.819345Z","title":"Multimodal reasoning with multimodal knowledge graph.arXiv preprint arXiv:2406.02030, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.819345Z"},"links":{"cited_paper":"/paper/2406.02030","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:657de390924ee59dffb433c10a5290c626f95408051486d169b4c08221b5d848","observation_id":"6c089fd8-d280-4021-97cd-dbdd99f5ce81","resolution":{"observed_at":"2026-08-07T05:35:50.819345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.823707Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks.Advances in neural information processing systems, 33:9459–9474, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.823707Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:73ff368cf5978be8d4eda7c34293711cd1b08fffcf58f9c44b1e53df6ba2eeb3","observation_id":"351fcb6e-6148-4978-b96e-70ca201633ab","resolution":{"observed_at":"2026-08-07T05:35:50.823707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.828025Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.828025Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:0f04b460fec29112f7a8d6a68c947a9a791ccece2b04510ae8eb84c963ce9505","observation_id":"b98855b0-59d2-4594-862a-32d7436c411f","resolution":{"observed_at":"2026-08-07T05:35:50.828025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T05:35:50.832358Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.832358Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:3c169eb6c7aff0b58b2de0eca63ae4adb7f8066ad3230a5517bde1a2a8c9929d","observation_id":"c19432be-2e3c-44ab-82f5-9ad99d1453ae","resolution":{"observed_at":"2026-08-07T05:35:50.832358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.837354Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.837354Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:9d4f342a666114ab08e0e7a129ff0925c43162dfb9da242d0ec61b3f07d173b1","observation_id":"5542f591-d7eb-4a35-9ee4-6c374c36ef95","resolution":{"observed_at":"2026-08-07T05:35:50.837354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06353","last_updated":"2020-09-15T13:27:13Z","snapshot_observed_at":"2026-07-06T08:57:29.493849Z","submitted_at":"2020-02-15T10:03:25Z","title":"UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06353","snapshot_observed_at":"2026-08-07T05:35:50.842483Z","title":"Univl: A unified video and language pre-training model for multimodal understanding and generation.arXiv preprint arXiv:2002.06353, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.842483Z"},"links":{"cited_paper":"/paper/2002.06353","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:1823e6602436a194b8a7f8edd5ba79892a343d3979bc4387b36c167d24120232","observation_id":"8bde4f57-de10-42fb-a65a-61b852cbd1d7","resolution":{"observed_at":"2026-08-07T05:35:50.842483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.877569Z","title":"The impact of continuity editing in narrative film on event segmentation.Cognitive science, 35(8):1489–1517, 2011","venue":null,"work_id":"4d3da89d-5958-4e5b-8e31-b21d3847c8f7","year":2011},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.847978Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:bd09ef3b14955cf8e396d74338ba9f0635db1f341dc2806c236c9993b05a3871","observation_id":"13c512e3-d06d-4697-80a8-633f478325e7","resolution":{"observed_at":"2026-08-07T05:35:51.883271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.861025Z","title":"Learning joint embedding with multimodal cues for cross-modal video-text retrieval","venue":null,"work_id":"74381ef9-c2d1-44b1-a077-2bfd5ee9442e","year":2018},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.852386Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:0472d06c0dd7ad884ad1156c5e79be5e2eb0e43879b293e5992f96c03d1589b8","observation_id":"06cd2825-1733-4f1c-b7ce-5c6ed7b1e87f","resolution":{"observed_at":"2026-08-07T05:35:51.866744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05277","last_updated":"2022-01-14T02:14:07Z","snapshot_observed_at":"2026-08-06T15:50:23.335776Z","submitted_at":"2022-01-14T02:14:07Z","title":"Boundary-aware Self-supervised Learning for Video Scene Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05277","snapshot_observed_at":"2026-08-07T05:35:50.858475Z","title":"Boundary-aware self-supervised learning for video scene segmentation.arXiv preprint arXiv:2201.05277, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.858475Z"},"links":{"cited_paper":"/paper/2201.05277","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:6a7104a7816fa434395bd31ffb635a6370c8eaac3161e9da85f6cd3eaea29861","observation_id":"bc233881-faed-4732-8fd9-8fe0c8ade76d","resolution":{"observed_at":"2026-08-07T05:35:50.858475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.844122Z","title":"Video shot boundary detection: a review","venue":null,"work_id":"153ce323-0330-40a9-91da-6400788f0f81","year":2015},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.863274Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:01db1a6759038c95b11d72247fc23fd496f998a26d79f6fd8f6e24369548c99d","observation_id":"4ffcb655-c661-401a-9aee-a54baf56b1ce","resolution":{"observed_at":"2026-08-07T05:35:51.849862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.827095Z","title":"What is a multi-modal knowledge graph: A survey.Big Data Research, 32:100380, 2023","venue":null,"work_id":"ab56feec-d025-4d24-9a5f-bc4fb614522f","year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.867733Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:5fd09a831ebd8e34cba6ec6643c58a1698ab244b3a3430a86384f09a93cc8485","observation_id":"62a16ffe-9666-4ddb-8c19-34f9ce839849","resolution":{"observed_at":"2026-08-07T05:35:51.832449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.872103Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.872103Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:22f1bc761abc0ab6e0f3823873773db678d708fc2b37055b57e19c6a263f2e0e","observation_id":"0e5e5683-a5e7-4451-a79b-9e0c6bf79174","resolution":{"observed_at":"2026-08-07T05:35:50.872103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.876870Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.876870Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:9e1bf15879b3d386d3569ffbeab2f12b38c458974b477ec80866a846d8fe9fa8","observation_id":"0c2e3e7c-3ea5-4db7-ba22-9e6a489e87bc","resolution":{"observed_at":"2026-08-07T05:35:50.876870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01549","last_updated":"2025-02-03T17:30:19Z","snapshot_observed_at":"2026-08-07T22:11:52.617814Z","submitted_at":"2025-02-03T17:30:19Z","title":"VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01549","snapshot_observed_at":"2026-08-07T05:35:50.881284Z","title":"Videorag: Retrieval-augmented generation with extreme long-context videos.arXiv preprint arXiv:2502.01549, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.881284Z"},"links":{"cited_paper":"/paper/2502.01549","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:fdb3f70b63a28913eddb21c35f54185983fd8ce58b41e63fe3eef1baf7211d6b","observation_id":"569ffada-7c69-455a-ba47-b05e7ad7e021","resolution":{"observed_at":"2026-08-07T05:35:50.881284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.787459Z","title":"Temporal video segmentation to scenes using high-level audiovisual features.IEEE Transactions on Circuits and Systems for Video Technology, 21(8):1163–1177, 2011","venue":null,"work_id":"f0f71412-72fd-464a-b1aa-88c2557376c0","year":2011},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.885872Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:b1580ecd91137a7792274260205f7f78ace2adb31e48f4f296842e824456d137","observation_id":"3bf78b05-a0ad-4f6c-bd63-585137abeb79","resolution":{"observed_at":"2026-08-07T05:35:51.792701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.770537Z","title":"Videobert: A joint model for video and language representation learning","venue":null,"work_id":"0672ca1d-7764-4c51-a0c2-cb3148c97782","year":2019},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.890403Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:b59f8542e4eb91ad5bbe92a8ac4a8ef96a850822c0165d9752fe1556e5e9639e","observation_id":"dfd66a0f-e71e-4f30-b259-61b9958a83e3","resolution":{"observed_at":"2026-08-07T05:35:51.775488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.753668Z","title":"Temporal scene montage for self- supervised video scene boundary detection.ACM Transactions on Multimedia Computing, Communi- cations and Applications, 20(7):1–19, 2024","venue":null,"work_id":"835a28e9-0482-43ff-b4fa-1992c084a4ca","year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.894622Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:5019a16753e6b0c2cbfe00ef163b88b25d8be53165d2ec9b357a89554061a4fd","observation_id":"9a62d48e-553a-420c-b665-e452fc124e47","resolution":{"observed_at":"2026-08-07T05:35:51.758787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.898518Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.898518Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:efe98cfa975c3a2080a90e28f85b68cbd83aebdc30fc699f4777f32f2a0088ce","observation_id":"7d489f82-4221-48ca-93fe-4945e8906294","resolution":{"observed_at":"2026-08-07T05:35:50.898518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.726981Z","title":"Scene consistency representation learning for video scene segmentation","venue":null,"work_id":"7c10d83d-ee2a-4d97-b6f1-ad1f81a7b602","year":2022},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.902567Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:d1bce4962228534a946426807894316ea1b7d032511835d6542b0d0d8bcf71f6","observation_id":"539bc9a7-3595-46ab-8a8e-871564008167","resolution":{"observed_at":"2026-08-07T05:35:51.731995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-07T05:35:50.906801Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding.arXiv preprint arXiv:2109.14084, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.906801Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:ad074fe27ab25e111a303ddaefce1c7cc71f0ebb89a307e3aac420b1af5cd9f7","observation_id":"bbecc0ac-db34-4231-bf89-b3a95d52059a","resolution":{"observed_at":"2026-08-07T05:35:50.906801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.710337Z","title":"Retrieval- augmented egocentric video captioning","venue":null,"work_id":"db316cf6-dac3-4d1c-9fae-1773cd64c744","year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.911215Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:cfd182c008079998228a0016197cbe8a9e4679ab53f78ee8debda80738024d93","observation_id":"417c172f-13e5-4862-81ef-0eff5edd6e6a","resolution":{"observed_at":"2026-08-07T05:35:51.715997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T05:35:50.915326Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.915326Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:d31162a451f430adf105524d3c4823e9ce4ace4fc4a81675f795aec6fa2bd9be","observation_id":"b844bde7-bfd0-42a9-b90a-90514f00b513","resolution":{"observed_at":"2026-08-07T05:35:50.915326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.920388Z","title":"Momentseeker: A comprehensive benchmark and a strong baseline for moment retrieval within long videos.arXiv preprint arXiv:2502.12558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.920388Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:bd8e7ca9324631038df39834ac8fc40cb776c6da4138893e8fbc04a046efa80b","observation_id":"e7a23ea1-dcb5-4a6d-a212-4b6c0bf8ac72","resolution":{"observed_at":"2026-08-07T05:35:50.920388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.694000Z","title":"A formal study of shot boundary detection.IEEE transactions on circuits and systems for video technology, 17(2):168–186, 2007","venue":null,"work_id":"490e6d93-a6da-47ef-b27b-c26af5876cc1","year":2007},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.924862Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:52eed53ee3c077cb025345f7bfaefee959146cb28a7a3989d6134cd09fb60728","observation_id":"3d972c0f-14f9-4ff4-87b8-55fc80973776","resolution":{"observed_at":"2026-08-07T05:35:51.699263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.678121Z","title":"The brain’s cutting- room floor: Segmentation of narrative cinema.Frontiers in human neuroscience, 4:168, 2010","venue":null,"work_id":"6c89883a-d361-4e8c-b5cb-d421013a703d","year":2010},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.929441Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:bb3f46087fa28fd144e85e86593e3a51b326450050c3aedcf3710f4cedf5e31c","observation_id":"8cdd8dc1-7a4b-429b-b457-13c683723b0f","resolution":{"observed_at":"2026-08-07T05:35:51.683472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.662129Z","title":"Merlot reserve: Neural script knowledge through vision and language and sound","venue":null,"work_id":"8306f5b9-a326-406e-890f-930d5edd30b5","year":2022},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.935121Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:5aaf18fb674db00e70e56b852578910739ed3a102f5e76e87a73c6fdc4911451","observation_id":"94805a66-2b73-4012-b5ab-e94a4f8e294d","resolution":{"observed_at":"2026-08-07T05:35:51.667190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09823","last_updated":"2025-04-14T02:47:23Z","snapshot_observed_at":"2026-08-07T16:06:03.524881Z","submitted_at":"2025-04-14T02:47:23Z","title":"RAKG:Document-level Retrieval Augmented Knowledge Graph Construction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09823","snapshot_observed_at":"2026-08-07T05:35:50.939358Z","title":"Rakg: Document-level retrieval augmented knowledge graph construction.arXiv preprint arXiv:2504.09823, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.939358Z"},"links":{"cited_paper":"/paper/2504.09823","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:bfe92111b394e5604668e5ddb2dd7a31a2dc6b6e744a0c797b2d2a230af0916b","observation_id":"74bf6da5-efe4-415c-8d58-fe897a7d3590","resolution":{"observed_at":"2026-08-07T05:35:50.939358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T05:35:50.943960Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.943960Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:7a23aea962dbe2a73cd5a7c53fc5562b5cf84daaf60c1ba41c98928a4ae8331b","observation_id":"6722b5b0-1c8d-4a75-a47b-60ab28d58aa8","resolution":{"observed_at":"2026-08-07T05:35:50.943960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.590105Z","title":"Please maintain the required format in your response","venue":null,"work_id":"72103f65-fac4-4beb-8221-f727d664f4e6","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.967095Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:552fc47d1f77c18dc0720d5243636b723a49a22e8f6ab0fc2897925d3527b5e9","observation_id":"8ff9f0a4-ca16-4e0f-a52a-b64249c31166","resolution":{"observed_at":"2026-08-07T05:35:51.595091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.642030Z","title":null,"venue":null,"work_id":"cfe19b2d-6ffe-4ff9-8712-931e0966c5ef","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.971971Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:fd63cda303fc3a02ba400bfcf5902d2e1d831897ed4428bd427c4aa58de2929e","observation_id":"66e0bc2a-77d6-4210-af0d-cb3bf0ebfd8c","resolution":{"observed_at":"2026-08-07T05:35:51.650621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.555891Z","title":"Please maintain the required format in your response","venue":null,"work_id":"01569010-772c-41ac-b397-f30c05b7df74","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.989912Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:6180e17df974ab00663746917c65370bc6de7efded0ed8a6a9a369dd194048b6","observation_id":"5b9ec369-cc81-4154-bc82-1272e2439b41","resolution":{"observed_at":"2026-08-07T05:35:51.560866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.531198Z","title":null,"venue":null,"work_id":"a8a7b454-c890-4d30-93e8-37561d4b866d","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.994061Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:da8aadcb44037ed5e21a0686721fc992db161d0fd46a2b99029077ea42825f9a","observation_id":"7353939f-dbf5-4101-88c7-32311ade0fd3","resolution":{"observed_at":"2026-08-07T05:35:51.536324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.624871Z","title":null,"venue":null,"work_id":"57c18f10-bff3-4587-8df4-27bae73b25f8","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.998519Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:389e14e3bce980ee0f40eecef89db8b1ba3ac419ffb4223d615dc0f3f69ca418","observation_id":"39d875e6-f1c9-4291-9ae0-0c50abad866e","resolution":{"observed_at":"2026-08-07T05:35:51.629732Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.607607Z","title":null,"venue":null,"work_id":"88d9b054-3fa2-4375-a784-a1d4ebcac3af","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:51.002426Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:52802a93b801fd03905697b5c3c9dde4a2bf253157fe83f9ae3c7e2a82ab0239","observation_id":"bf189050-0e90-4dd1-835d-073c1343bfd4","resolution":{"observed_at":"2026-08-07T05:35:51.612920Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.573297Z","title":null,"venue":null,"work_id":"7e1497c9-5218-42cf-a584-777b2659e29c","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:51.006523Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:d2e13819d2101853b84751f9e9f3e5384fa9c558305c7cba4f203fb91d0be3df","observation_id":"dcc53b3c-47fd-46e1-8b8d-b7856737744b","resolution":{"observed_at":"2026-08-07T05:35:51.578428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.512376Z","title":"Is This the End of RAG? Anthropic’s NEW Prompt Caching","venue":null,"work_id":"9f338447-80b7-4a42-999e-a461bb088410","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:51.010785Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:1d9dd2244479005459086f80eaee860ec0a30c9fb0a221c2a1264eff1de88484","observation_id":"56d795ad-6a2c-412d-b5f2-5fdaba24c93f","resolution":{"observed_at":"2026-08-07T05:35:51.519683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T22:13:58.749357Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 2 inbound Pith citation observations for arXiv:2506.07600."}