{"as_of":"2026-08-03T10:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c7125dd50fd4c892bd7e7c32fe9bb7b6f311aed7dbb068ad3875abfaafd3bb1","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T06:51:52.861981Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:40:44.418468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.17052","snapshot_observed_at":"2026-08-02T05:40:44.418468Z","title":"Oasis: On-demand hierarchical event memory for streaming video reasoning.arXiv preprint arXiv:2604.17052, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-02T05:40:38.635216Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:44.418468Z"},"links":{"cited_paper":"/paper/2604.17052","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:b24ca9923af8df36cf96edd0ba5f4bdfeffc1e5b350920719e0567549415ded9","observation_id":"1091435e-598c-427f-a6a2-4e5c27be402c","resolution":{"observed_at":"2026-08-02T05:40:44.418468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.17052/citation-record","integrity":"/paper/2604.17052/integrity","json":"/paper/2604.17052/citation-record.json","paper":"/paper/2604.17052"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:d611ed9604d3c5d37c2799209969be95f62d9678548f6dabaa855fbfb9f12e8a","observation_id":"dfed266d-8e08-4ed7-b2c9-11da36ecdcbc","resolution":{"observed_at":"2026-05-10T06:56:47.767027Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flexible frame selection for efficient video reasoning","venue":null,"work_id":"810f31b2-df86-4512-a04f-be6b1c647beb","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:af16fccb9f38dbb11bbb6b44783f98ce6e4df1f3e3a5b873b2044ee92da99bde","observation_id":"5faad177-1ac3-4c95-af61-b1a605631847","resolution":{"observed_at":"2026-05-21T15:10:17.605050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"more info","venue":null,"work_id":"21f86c06-79fc-412f-bd58-ff611f17b10c","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:750710510f17d174513e43e6d2e9a4a1e03b79f23e3ccd012fd7e46837b144fa","observation_id":"60ccb89f-256b-4b76-b82b-9b3ac6b25793","resolution":{"observed_at":"2026-05-21T15:10:17.601851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videollm-online: Online video You are an event summarizer for a Short-Term Memory (STM) video window","venue":null,"work_id":"4d06b7e5-dcaa-4d44-ab40-2f32a2ed9361","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:48052d2d8e0cffc518b04e3e8ef6c2531e23d97506f442a4a86ffffc9bba9423","observation_id":"51939c38-04dc-4e1c-abf0-e744239c04b5","resolution":{"observed_at":"2026-05-21T15:10:17.575300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"No reordering across time","venue":null,"work_id":"6c782f96-f57b-44b3-b829-a3f00d2c991b","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:be662fab58113df45345311c8a08bb7ec685ba61372cfd93e4a9c2985ebb3c42","observation_id":"3f9927b7-aba0-4cc9-8cad-cdd2b1dd30a0","resolution":{"observed_at":"2026-05-21T15:10:17.598849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"unidentified/unclear","venue":null,"work_id":"2e4c8a71-ba02-42c3-a9e0-e5747456d0dc","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:28cca2f01e5ca3af9503e9e3f9d8cb81fc60f75df7ebc8652edc595732bc0f21","observation_id":"a29cd987-3004-421b-ae4f-074ae086e07b","resolution":{"observed_at":"2026-05-21T15:10:17.562483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ffaea943-d451-47b3-83ea-607807c6e018","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:504b22de94ff25acaf148a1f49b49976bc3f5b07403e4d9153bb61c5e7258248","observation_id":"1de46bdd-38ca-49f3-98b3-aadc5ebfd7d4","resolution":{"observed_at":"2026-05-21T15:10:17.578496Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f7835a3f-6efd-45f2-a242-8228e18ac43d","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:b6e4132a82b6c56835d64fae71769f81e6611e2a0cf9e6466baab52f8e84bfa1","observation_id":"8abe22a9-3b23-4f22-b0c9-592d47a95f54","resolution":{"observed_at":"2026-05-21T15:10:17.584754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"ab82f664-ba9b-400b-b360-5268b454d36e","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:8ccfd25088abcc0770130b5b6151812874fd606f0c1307994ea932436570b0bd","observation_id":"6803b0d1-d183-4838-9ea4-79a4d2e8c269","resolution":{"observed_at":"2026-05-21T15:10:17.590855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06299","last_updated":"2024-09-10T07:53:10Z","snapshot_observed_at":"2026-08-01T07:55:00.368118Z","submitted_at":"2024-09-10T07:53:10Z","title":"Enhancing Long Video Understanding via Hierarchical Event-Based Memory","version":1},"cited_work":{"arxiv_id":"2409.06299","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06299","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing long video understanding via hierarchical event-based memory","venue":null,"work_id":"f9a88b40-2429-4909-b7fd-e01b3163f670","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2409.06299","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:6db0d1102c63d1ec1d79bbf46ff65393e065840f4b84637093a7836e2ab90fe2","observation_id":"1ea6c5a7-7a02-4180-bcca-30d28f4fcb9f","resolution":{"observed_at":"2026-05-10T06:56:47.799041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You receive the current QA history summary S and a new QA","venue":null,"work_id":"3aa24852-5e14-4732-8975-55d3fc69941f","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:9772b0f304b8155765f4d5458f3cb744f5775f163b7198280a47548ef199960b","observation_id":"adb34897-f0ab-4d51-90d6-0446a0e931b7","resolution":{"observed_at":"2026-05-21T15:10:17.587689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"11b35873-de03-42f3-b94c-c179271988b6","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:eedd0d42c1bb1aed1f1b6ed61c8654678aea87305a3697dba637f910ba7202e1","observation_id":"3c0e63da-48ef-4fa2-95db-eb164510d7b4","resolution":{"observed_at":"2026-05-21T15:10:17.596290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"who/what/key changes","venue":null,"work_id":"0612e6a3-eb92-4e5f-8757-c97b0b3d9c43","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:a4e1307236454b94f4ec4d49bedba68d4f9be9a61a042ca7fefb14e4291773af","observation_id":"5673bdd0-e2a6-4cee-ac13-bbe842ac572a","resolution":{"observed_at":"2026-05-21T15:10:17.497716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"34efc97d-1ba0-40b1-810f-162950d02995","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:21241240e66b226a01ae5338165cdbcbdac9d7f67ec50b847c83e949d3bb8ab5","observation_id":"d5b286d2-9698-4ad5-ae19-03a4e492b9b1","resolution":{"observed_at":"2026-05-21T15:10:17.500537Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c1c6bd96-8725-4a15-aca4-8a4d9867da4e","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:706c7a669d13052d4198d0ca7bbe82f97370a78e31196390e53a28604d442e10","observation_id":"e3cbba0c-b9bc-4497-80a4-7d371455e89c","resolution":{"observed_at":"2026-05-21T15:10:17.502769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Given the QA history summary S: {QA_summary_all} Given the new QA (including questions and answers): {QA} Now output the updated summary: Figure 10","venue":null,"work_id":"d8543c34-8b55-4848-96e5-705a2e237929","year":2023},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:e645d77924b3929ac33a3f60e91565e817d419eb9b739820117faa53ebc63dee","observation_id":"0ce46aec-897e-4eaf-b6c2-9bba92f0adaa","resolution":{"observed_at":"2026-05-21T15:10:17.504948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoagent: A memory-augmented mul- timodal agent for video understanding","venue":null,"work_id":"8d2fe3db-8d9c-46ea-bfff-a9564bbc83d1","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:135edfceb2a3b1d1b2a44f236b78495c5e665f6b65fb3e88804c91e327d530a7","observation_id":"81a4cc17-39ac-4117-98a1-a1a3128c85fd","resolution":{"observed_at":"2026-05-21T15:10:17.507810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:7526929d045bb4921050d80fb28bab63ad9354b063829b5968f1f747aea3b063","observation_id":"25c3b223-320a-4250-99b3-58a83036e7ce","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks.Ad- vances in neural information processing systems, 33:9459– 9474","venue":null,"work_id":"5d1b622a-8efb-403e-bee0-4d2efca333d0","year":2020},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:0fe7796a5baa9b63e8a9cd6541e94ed43c0129e0259d0fc1a09288413aea7c95","observation_id":"10b5233c-6c7c-48b3-b4c1-c709db1f5ff5","resolution":{"observed_at":"2026-05-21T15:10:17.510861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-10T13:27:05.574543Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:14f0a9967b8bbc678a002206d8c26961ff0decc6ec0695394e328c0b3b652f6a","observation_id":"40a8a6c1-ff4a-44d7-9cd5-ccec4d330627","resolution":{"observed_at":"2026-05-10T06:56:47.743590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guided: Granular understanding via identification, de- tection, and discrimination for fine-grained open-vocabulary object detection","venue":null,"work_id":"7f4788da-63f5-48f6-b56e-cd8908313259","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:287ea7525e83bd0a8061ceaf04b99fb39fbd14c327aa6ab173a7adeea1ea2f3a","observation_id":"4c542cfb-8090-427f-813e-30ea793ee68b","resolution":{"observed_at":"2026-05-21T15:10:17.560096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":"2305.06355","doi":"10.48550/arxiv.2305.06355","metadata_source":"pith","pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoChat: Chat-Centric Video Understanding","venue":"cs.CV","work_id":"07461eec-156c-4054-a28e-b84bc53bf6e1","year":2023},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:aa0e15a38f316f51b5b5f63e58efbc3cf27840d343f29dcd6a4d08e35c64c4d0","observation_id":"00c3a6ae-b540-425b-b579-ce9532e32861","resolution":{"observed_at":"2026-05-13T23:30:00.879549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mccd: Multi-agent collaboration-based compositional diffusion for complex text-to-image genera- tion","venue":null,"work_id":"5131c2be-4ff5-421b-aa57-16698994b6ac","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:c98d33af21c4097ceda9c0112b7fe773ed2e2033291d63d7ca6731e2215de3bd","observation_id":"4063a93c-b44d-422b-9e51-b2752a1b7516","resolution":{"observed_at":"2026-05-21T15:10:17.569628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lion-fs: Fast & slow video-language thinker as online video assistant","venue":null,"work_id":"4e0f071b-5c55-4a48-b7aa-99b5189cc220","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:3ea243909bd0ee3e7d8894264ae80d518fb79c06ea5f6b345741068ea4da962b","observation_id":"dedcbda0-a173-487c-9d9c-b08a6c47a88c","resolution":{"observed_at":"2026-05-21T15:10:17.552028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-vid: An im- age is worth 2 tokens in large language models","venue":null,"work_id":"235049fd-a13e-4882-ba81-89c8cd37fdbb","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:b4aea3fb4871d44d478ea9c28239f96efe0686bebb188e73a7285c851dd6c9e4","observation_id":"57c49ce6-4168-4c0e-8430-922fb12e27f9","resolution":{"observed_at":"2026-05-21T15:10:17.549327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03628","last_updated":"2024-11-06T02:50:30Z","snapshot_observed_at":"2026-07-06T19:45:57.808548Z","submitted_at":"2024-11-06T02:50:30Z","title":"StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":"2411.03628","doi":"10.48550/arxiv.2411.03628","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03628","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video un- derstanding","venue":null,"work_id":"caec985b-dd2d-4dbb-9199-d147732de99a","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2411.03628","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:d724fd76f77e0eedad0c9a863518d2162b049b76998c09a4487960eddf817ef5","observation_id":"5b490176-a817-4edf-8c78-e747aedccbaf","resolution":{"observed_at":"2026-05-10T06:56:47.757004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"55e87751-1ce5-4960-ab50-12b695a14218","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:4f5df1c5385db1fdf003da371257c08bbd4d5f061dda40b92e4d842874241f2c","observation_id":"5c9ab826-3e54-4198-9031-99a01acd056d","resolution":{"observed_at":"2026-05-21T15:10:17.557194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":"2408.15542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-07-04T00:29:15.346488Z","title":"Kangaroo: A powerful video-language model supporting long-context video input","venue":null,"work_id":"5e709eaf-2719-4a1e-8ee6-1d5f6f1ac2fd","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:dc4015f8f903c32a922d4480b2a5965cf75cea367a1a32ac2be647c859b86f00","observation_id":"3e04ced6-a4e9-4ed8-b2f9-66302f455250","resolution":{"observed_at":"2026-05-10T06:56:47.759603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.13444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:15.220876Z","title":"Videomind: A chain-of-lora agent for long video reasoning.arXiv preprint arXiv:2503.13444","venue":null,"work_id":"1f2528a0-5ff0-4485-abf2-cd56c6b0f520","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:0912a8a4976431c136ba296f4427986af38116294546431e389fb332d52db002","observation_id":"fd0fd08d-5cbb-43b7-af57-e717c47d2409","resolution":{"observed_at":"2026-05-10T06:56:47.762245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.13093","doi":"10.48550/arxiv.2411.13093","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2411.13093 , year=","venue":null,"work_id":"562846f0-01d3-4845-947d-9b1cd1003d84","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:cf7d005bde92fd0c62545d3e42f3ed80a37a57fa4d1461a44780e4f45c49b2fe","observation_id":"83eb7ee8-38a8-46e7-84d8-5392786b054a","resolution":{"observed_at":"2026-05-10T06:56:47.772600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:00:11.689603Z","title":"Video-chatgpt: Towards detailed video un- derstanding via large vision and language models","venue":null,"work_id":"ea22bf78-b4ce-45a2-ac64-30e0182f1a67","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:b74413db6aa85645a98f51a32b041c90a351c59da5f1538fb9dfd770669a641a","observation_id":"8ca350aa-59a0-430b-beba-86b1eeed089b","resolution":{"observed_at":"2026-05-21T15:10:17.544591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:59:55.994975Z","title":"Perez-Cabarcas, Utteja Kallakuri, Nicholas R","venue":null,"work_id":"f2756ee6-4814-4fce-86b8-b155d88accca","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:6a1c1faa1f73db76ebf14b1374908186033c63e2b20b94936ac502356043baea","observation_id":"0ff6e699-3b4f-48a8-8683-836aa28b71fd","resolution":{"observed_at":"2026-05-10T06:56:47.751589Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding? InProceedings of the Computer Vision and Pattern Recognition Conference, pages 18902–18913","venue":null,"work_id":"6e81e16a-5d4a-468c-bd18-35cb1a454bf1","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:b57dcf2ba739406bea7e4d84270ec6980df0a3ee2a84e6d67a256131757528f1","observation_id":"f179d86b-be93-4500-ab0a-8b62ca7ee8a4","resolution":{"observed_at":"2026-05-21T15:10:17.541722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:25:49.260079Z","title":"Gpt-4o system card","venue":null,"work_id":"ebd64501-fd2c-4ca6-981d-bf988eb57341","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:70fd480908e54b3a2ad55efa41b2567643bf94ffb3be8effa7bc7b7359640c44","observation_id":"9ea86b8c-e651-4423-86d7-1a64406c85d5","resolution":{"observed_at":"2026-05-21T15:10:17.532604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenAI (2024)","venue":null,"work_id":"fcaf361f-9543-415a-aea1-a052b467c0c6","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:b33c21525e7440c5076b8d004c3a561971e165707162a7dd03c4902954feb684","observation_id":"371fb666-c8b3-4149-8148-e843431e7de0","resolution":{"observed_at":"2026-05-21T15:10:17.607959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming long video un- derstanding with large language models.Advances in Neural Information Processing Systems, 37:119336–119360","venue":null,"work_id":"5606b94e-6cb1-4c17-8b70-6f0f591f4a4f","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:16604d3fe968bbd098e25e7cf86110f5fd30cb546b1dbfcdc2fa826d103636b6","observation_id":"25cc596d-ab05-4c0a-8498-3ac37a78ef18","resolution":{"observed_at":"2026-05-21T15:10:17.535849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dispider: Enabling video llms with active real-time interaction via dis- entangled perception, decision, and reaction","venue":null,"work_id":"3ac4302c-04cc-49c2-9355-9724d0788d21","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:3b4f623704b1aaa573ec491ae229b1b18cc329ef2d78858e5d6cee2cc3898678","observation_id":"d02f7d7f-ac7a-4745-a494-99b2b884e447","resolution":{"observed_at":"2026-05-21T15:10:17.538907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3-vl","venue":null,"work_id":"2a83c845-3934-4c6e-a83c-59ba8f7da214","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:cc119d7b84dda28ef3eaaadb104e2e5ce33e01466fb99731f18d1ed415eee229","observation_id":"ed2779bf-cbf8-473b-90a5-8b6a386e776c","resolution":{"observed_at":"2026-05-21T15:10:17.546940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybridrag: Integrating knowledge graphs and vector retrieval augmented generation for efficient information extraction","venue":null,"work_id":"05841352-ac50-41a7-8b32-1bef81c5938b","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:fd6dc14603b64b7ccc88f5bc34c706a4a73e4383ce5841b80b5b48a6442f30c0","observation_id":"87f0b2c3-6fb3-402a-8d5c-ebd30da33531","resolution":{"observed_at":"2026-05-21T15:10:17.554503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15294","last_updated":"2023-10-23T09:58:13Z","snapshot_observed_at":"2026-07-06T15:32:39.787935Z","submitted_at":"2023-05-24T16:17:36Z","title":"Enhancing Retrieval-Augmented Large Language Models with Iterative Retrieval-Generation Synergy","version":2},"cited_work":{"arxiv_id":"2305.15294","doi":"10.48550/arxiv.2305.15294","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15294","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Enhancing retrieval-augmented large language models with iterative retrieval-generation synergy","venue":null,"work_id":"0826d81f-256a-4b75-b51f-e008603cc3e6","year":2023},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2305.15294","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:361c94df9000b0d19f1fe15e9eb444dc7ecced1671d7432eca101ade1a2c02a6","observation_id":"072f22fa-f82e-4464-a88f-a23df7d3fc67","resolution":{"observed_at":"2026-05-10T06:56:47.746255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"e9fd4b50-1532-4605-8a48-328e26ed564f","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:5c048e9d21c94df79416b5becc9302cb6bb33927f00a790d6647d6c52cf67806","observation_id":"da0d31dd-23b0-4199-9f77-0d558e443c44","resolution":{"observed_at":"2026-05-21T15:10:17.572389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-07-11T03:37:46.178537Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:5118296cde91ce656833410f863fcb5e356a8bce8b5276480d138ba356b00656","observation_id":"10716463-084e-4d5e-895d-74c574652d70","resolution":{"observed_at":"2026-05-10T14:35:23.646633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sketchagent: Language- driven sequential sketch generation","venue":null,"work_id":"4f3e85a1-7e6a-461b-b24b-2bfce28c2265","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:5ee0977a64b7c0f33a8b56e115d33536575cc7c0ef7f9a60fd79bf10f18291e6","observation_id":"171be5be-a867-4420-95f7-589c5c780855","resolution":{"observed_at":"2026-05-21T15:10:17.513606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:bbbf33bed945296f6b271a7cd39bd1a1d51b755b9236127cb33d7272d8b7d78a","observation_id":"34156a0e-19ed-4e67-b742-74ba08168ac5","resolution":{"observed_at":"2026-05-10T06:56:47.730433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.09486","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Episodic memory representation for long- form video understanding.arXiv preprint arXiv:2508.09486","venue":null,"work_id":"a307e4f3-a1fd-4794-9ba7-5efc7f4f4a32","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:b4ab23067ba162b3c00718b4a43074b73ab150b588681a2c3215b98e1796c25d","observation_id":"fd37cfb4-fa0c-4dfb-9837-807f9b348711","resolution":{"observed_at":"2026-05-10T06:56:47.733230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":"d964e9a8-8acc-497b-95ba-8d68ddeab2a3","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:9c51bd8e0204861254715a07982a9155e6b078cdcebaa794ef1a0d52126632d4","observation_id":"ef562e52-ada9-4fc7-aeb1-9aedc34f9e11","resolution":{"observed_at":"2026-05-21T15:10:17.517874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual causal scene refinement for video question answering","venue":null,"work_id":"15fad46f-2bb6-4965-b9eb-8c845e27cad7","year":2023},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:f7c26fecf168f976190e3b174c67f75d9ccac1cd519e0ba1487bf072ab1b8e9e","observation_id":"7761e816-5aae-4fac-9e9b-d52a1557fd09","resolution":{"observed_at":"2026-05-21T15:10:17.520418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07798","last_updated":"2024-06-10T13:55:21Z","snapshot_observed_at":"2026-07-06T18:13:33.931286Z","submitted_at":"2024-05-13T14:42:13Z","title":"FreeVA: Offline MLLM as Training-Free Video Assistant","version":2},"cited_work":{"arxiv_id":"2405.07798","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.07798","snapshot_observed_at":"2026-07-02T02:26:27.049570Z","title":"Freeva: Offline mllm as training-free video assistant","venue":null,"work_id":"52a9a6f7-1016-4611-b7b6-4b095241f257","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2405.07798","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:05feb4ceb83b3806423f18dcaeba7989e904b70b601980a93648ac7f0ff828af","observation_id":"2a6bb1bf-f4bf-4ea8-b71a-c1c264bd725a","resolution":{"observed_at":"2026-05-10T06:56:47.735758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:6f21d9d800496b7e372368baf96225527983f5938fb39595415e6af608325973","observation_id":"9f617e8a-6e47-49b3-87a1-05614046708c","resolution":{"observed_at":"2026-05-10T06:56:47.738283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07611","last_updated":"2024-08-28T03:47:28Z","snapshot_observed_at":"2026-07-06T19:00:44.495107Z","submitted_at":"2024-08-14T15:19:16Z","title":"WeKnow-RAG: An Adaptive Approach for Retrieval-Augmented Generation Integrating Web Search and Knowledge Graphs","version":2},"cited_work":{"arxiv_id":"2408.07611","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.07611","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weknow-rag: An adaptive approach for retrieval-augmented generation integrating web search and knowledge graphs","venue":null,"work_id":"fde6ee05-5f57-49f0-82c1-82a675b72fb8","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2408.07611","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:8c5fca569e2ef60ad4a9895f5fd08b4b8c83b3cbe75c28ad85d8377c45ba66eb","observation_id":"3091e9f3-afc8-4eaf-a272-bac3130f63e0","resolution":{"observed_at":"2026-05-10T06:56:47.791244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13468","last_updated":"2025-01-23T08:33:10Z","snapshot_observed_at":"2026-07-06T20:24:50.262766Z","submitted_at":"2025-01-23T08:33:10Z","title":"Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge","version":1},"cited_work":{"arxiv_id":"2501.13468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13468","snapshot_observed_at":"2026-07-04T03:19:29.878882Z","title":"Streaming video under- standing and multi-round interaction with memory-enhanced knowledge","venue":null,"work_id":"05bede93-84f8-4b7b-b6e5-10f6ff02394b","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2501.13468","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:7f2b3af2958f550b81c43eac5deeaf451f09c8e74da8f2cc2245212b7f77745c","observation_id":"c1dcbb80-6dad-4874-a696-0d5d79bdd3e5","resolution":{"observed_at":"2026-05-10T06:56:47.801677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.10810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:41:04.328023Z","title":"Svbench: A benchmark with temporal multi-turn dialogues for streaming video understanding","venue":null,"work_id":"a96af222-b449-4d3e-b31d-c2fae15db9fd","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:2d683ae389ebe62d057d44887dbd6597f518f4872e52846aa912ab522198e1f0","observation_id":"b2e84f48-8a95-4e76-ac69-a05129fa6d4d","resolution":{"observed_at":"2026-05-10T06:56:47.782864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Timechat-online: 80% visual tokens are naturally redundant in streaming videos","venue":null,"work_id":"9e68e0ea-5450-4593-bd7d-e781eaeebb8f","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:68c422d8f755a70b47eddaa231dc2460c5d429729356c3a6a99b1a0a69d97221","observation_id":"4e535c03-5412-4533-8e96-f2cfaeb69096","resolution":{"observed_at":"2026-05-21T15:10:17.523046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:7e6f0604b94e6a5973914d48783ff22fb73a1e5fe571799bf9459cdd1260ae50","observation_id":"2fcd1dc1-d7da-4f16-9992-9689be06ba2d","resolution":{"observed_at":"2026-05-10T21:07:32.698795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re- thinking temporal search for long-form video understanding","venue":null,"work_id":"dd86ca8e-5cc0-45dc-ab57-5b1387af0f2e","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:ded52bc715974522debc770fb8048139dc405b53acf7816ec7dda0f0284b7567","observation_id":"2279a260-3b8e-4ae4-8d32-310aca548afb","resolution":{"observed_at":"2026-05-21T15:10:17.526447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:7c0ce77e8b4e6b3eba4a47812688622db7d4a1091038960dadea04104d24c7f8","observation_id":"06bb0f4f-f16a-48d2-9ff6-5bc1390fabbc","resolution":{"observed_at":"2026-05-10T06:56:47.793873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V-stylist: Video stylization via collaboration and reflection of mllm agents","venue":null,"work_id":"17fec7f4-85e7-4a41-bc0b-1f1e4c2400de","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:b4107e97d079fad5fad60291fd0532e1f7874700aa973c0c1906c45416581272","observation_id":"f243cc56-e3ea-4e9b-b58e-084ae33e6ae3","resolution":{"observed_at":"2026-05-21T15:10:17.529510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":"2501.13106","doi":"10.48550/arxiv.2501.13106","metadata_source":"pith","pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","venue":"cs.CV","work_id":"38f52461-37fd-4266-bc46-9dea31be2824","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:748509ce7be8fbe67baed8ffe76e2bfc930de88d269e1fb0f7ad39d696b40ddb","observation_id":"08875976-6a26-42b3-9bb9-96a1e256d6a3","resolution":{"observed_at":"2026-05-11T01:20:00.737157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":"2306.02858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-04T16:29:57.761121Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":"cs.CL","work_id":"555cf04a-49a7-44b8-9019-a83ce85ace95","year":2023},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:b72ec0e8a93006ce4beb4dd2ca522c7ae9a2e433b9a12390646e16792f3bd812","observation_id":"d6f402d9-f3c3-4625-87bf-58df85578b67","resolution":{"observed_at":"2026-05-13T15:02:01.218694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-07-06T18:29:30.075334Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":"2406.08085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-07-04T20:00:08.182505Z","title":"Flash-vstream: Memory-based real-time understanding for long video streams","venue":null,"work_id":"f53e5fea-3444-480b-aa38-be98378c0ced","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:2ab3e7f6c64d9f14433cecaad0022288732fd0507280b56f46aeca857224f4a3","observation_id":"266777e1-7e61-40fb-aea8-674cb00bbeca","resolution":{"observed_at":"2026-05-10T06:56:47.788325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23825","last_updated":"2025-07-24T07:25:10Z","snapshot_observed_at":"2026-07-06T21:49:42.283940Z","submitted_at":"2025-06-30T13:17:49Z","title":"Flash-VStream: Efficient Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":"2506.23825","doi":"10.48550/arxiv.2506.23825","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23825","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2506.23825 , year=","venue":null,"work_id":"d524fa9c-c052-4e82-bdda-e6a3955f763e","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2506.23825","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:14dde90beb4dbd144b8244ca430ee5d64ade18eb13e16cdb9489aec8fe42251e","observation_id":"78041cb7-9628-4162-a2e3-c47795275266","resolution":{"observed_at":"2026-05-10T06:56:47.780231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-03T08:18:14.565310Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":"2407.03320","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-07-03T20:38:56.215264Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","venue":"cs.CV","work_id":"930005ca-91e5-4ee8-a634-1684c76d8cf9","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:1d606ab8d8713daefad687695a84e87c1caa55e299b3fc2d4d177fca0c61504f","observation_id":"65a8c81a-a655-469d-8466-8e43ab2e1168","resolution":{"observed_at":"2026-05-17T10:46:29.265418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:21c412179fbe6c580e29b4b2f50e64083ebe0860f8e050b418e209271d570eda","observation_id":"0d825d63-2330-46e5-beb2-60a149bad419","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference op- timization of video large multimodal models from language model reward","venue":null,"work_id":"e91ff4df-eb14-4dfe-9be4-8eb798745813","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:c414fe5174cbee9592a3c0c25e91917cee1c17a0c734c7976d18f037840055ea","observation_id":"69b77b88-be63-4dc6-bb1a-eac701ff960a","resolution":{"observed_at":"2026-05-21T15:10:17.564893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:1d79778e815bdfb0184bb218938854a53663e009f3d090276c542f0e9dd32fd3","observation_id":"bbeda2b2-99c1-45fe-a3a9-076de90db7f9","resolution":{"observed_at":"2026-05-10T06:56:47.775140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":"2506.05176","doi":"10.1016/j.displa.2025.103255","metadata_source":"pith","pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","venue":"cs.CL","work_id":"bab684a8-d933-426c-a19e-2c855a0d1f59","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:7eb52bfaf2fd7abeeae2d5b169faf3a7c8af7d9042b476efd1c9f9ec237e89ab","observation_id":"f41e943b-a428-4111-8d0f-ac1addd7d716","resolution":{"observed_at":"2026-05-10T13:46:09.919088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.10516","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cogstream: Context-guided streaming video question answering.arXiv preprint arXiv:2506.10516","venue":null,"work_id":"675606f8-f10c-46e5-9946-daf460ff42ce","year":null},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:70c6f0d9b03ea9d32cd53d5da097179a415ea5c217e3c1b15a17c3db62c04601","observation_id":"14ca2e13-4bab-4e1f-94e5-6b22cfb4837d","resolution":{"observed_at":"2026-05-10T06:56:47.754428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical event memory for accurate and low- latency online video temporal grounding","venue":null,"work_id":"502e31aa-01e9-4c8d-89cb-7767ce0e502e","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:9cd37bc658f913e7711f5d6066c28bf8a9fb5a3f5b5bf165b9d043713a7311a8","observation_id":"94c0a5f6-50e0-4bce-934d-bfcd244a46c4","resolution":{"observed_at":"2026-05-21T15:10:17.593664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":5,"verified_exact":28,"verified_fuzzy":33},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2604.17052."}