{"as_of":"2026-08-07T09:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:08db40e118148bad2766c538ec34c85de52d3fc15a77379a38bf2ab1456e3c8e","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:49:42.909084Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.03039/citation-record","integrity":"/paper/2508.03039/integrity","json":"/paper/2508.03039/citation-record.json","paper":"/paper/2508.03039"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2007.00394","last_updated":"2023-05-17T07:56:52Z","snapshot_observed_at":"2026-07-06T09:34:24.643148Z","submitted_at":"2020-07-01T11:34:46Z","title":"The IKEA ASM Dataset: Understanding People Assembling Furniture through Actions, Objects and Pose","version":2},"cited_work":{"arxiv_id":"2007.00394","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.00394","snapshot_observed_at":"2026-08-06T04:49:44.809694Z","title":"The IKEA ASM Dataset: Understanding People Assembling Furniture through Actions, Objects and Pose","venue":"cs.CV","work_id":"c07c8a5c-40e7-408e-b3d2-ab27c67acd0a","year":2020},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.193595Z"},"links":{"cited_paper":"/paper/2007.00394","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:a2954c09cea5ad5787d7f1853832f70f0fe8e27b3ce368fcaa43bc05cc81dbf2","observation_id":"d0fc53e2-d681-4262-9f49-feb7351126b9","resolution":{"observed_at":"2026-08-06T04:49:44.836759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T04:49:37.262227Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.262227Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:77294a6cb3ea5e6f12505f497d239b8acf38cb9e3258d7afe90a4d0274154f45","observation_id":"8916b5d6-5696-4ab6-85bb-0c4570017a2e","resolution":{"observed_at":"2026-08-06T04:49:37.262227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-06T04:49:37.375757Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.375757Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:f0f3d91f95c5d450116aeca002ce216e58617506324749fe5738b9e04e6a69c5","observation_id":"dbbd0beb-e5af-453c-862f-f1b19e196efe","resolution":{"observed_at":"2026-08-06T04:49:37.375757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T04:49:37.464967Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.464967Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:df2ab790082cb6b7fd61b146749c9af203285cd2eed6e688e00fe3a8f8029114","observation_id":"457862a8-afb3-48f7-85d2-efa803b70330","resolution":{"observed_at":"2026-08-06T04:49:37.464967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06299","last_updated":"2024-09-10T07:53:10Z","snapshot_observed_at":"2026-08-01T07:55:00.368118Z","submitted_at":"2024-09-10T07:53:10Z","title":"Enhancing Long Video Understanding via Hierarchical Event-Based Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06299","snapshot_observed_at":"2026-08-06T04:49:37.562864Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.562864Z"},"links":{"cited_paper":"/paper/2409.06299","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:6faa9e2f6559d2be4af4f4437e64413f2b51df288fabe2e4c89efaac7bf69012","observation_id":"4ed2ed85-0e9d-4dc1-a83a-a32078302cf0","resolution":{"observed_at":"2026-08-06T04:49:37.562864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T04:49:37.643512Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.643512Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:7ad1637c03d8c8b98a7c8bedf56994f80f4d5f13e04068f187538e923c814078","observation_id":"e691ea34-fc65-4152-ac4c-de2035cca43e","resolution":{"observed_at":"2026-08-06T04:49:37.643512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.943382Z","title":null,"venue":null,"work_id":"174dca4c-1341-4b67-9963-5d0cd2542025","year":2025},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.738710Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:6c5bede41b8e94765c6e3026bf3ccf2d5dabc193d19df082ea7726c9386af2c4","observation_id":"a74b6568-0c14-4b40-bcfd-65d75c08ab60","resolution":{"observed_at":"2026-08-06T04:49:45.982958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.33934","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:44.589851Z","title":null,"venue":null,"work_id":"43eb24ea-a2d7-436a-babb-a83706a0ad13","year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.840755Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:a33a68d61ed4de467b8de5d53d10fa2d0b46ec910ffed4ad7ddb64894dfa2ad4","observation_id":"59dd60d2-be20-446d-ac9c-a41ce768a327","resolution":{"observed_at":"2026-08-06T04:49:44.688355Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-06T04:49:37.951565Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.951565Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:75768d0d40afcf5b206936675471b3f1a6fa305e0c682b64c94b59f925c8fca7","observation_id":"d8855dac-cc08-4c80-8e64-ec425fe59203","resolution":{"observed_at":"2026-08-06T04:49:37.951565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T04:49:38.032079Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.032079Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:73f916a74dcd2534ccad79512c6db593c8daf422c7ffd65831b01c4fdea6d2c1","observation_id":"39f00fc1-9517-4c66-b420-af0ad379cf9d","resolution":{"observed_at":"2026-08-06T04:49:38.032079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:38.149590Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.149590Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:f7eda0e8e2a22d60f2558373a7cd617c6cc31e46e84bbda997a735425bdc5c25","observation_id":"4c12f38d-35bd-4389-bdcc-01ab01d93e16","resolution":{"observed_at":"2026-08-06T04:49:38.149590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13250","last_updated":"2024-05-16T12:23:05Z","snapshot_observed_at":"2026-07-06T17:33:00.716054Z","submitted_at":"2024-02-20T18:58:54Z","title":"Video ReCap: Recursive Captioning of Hour-Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13250","snapshot_observed_at":"2026-08-06T04:49:38.388595Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.388595Z"},"links":{"cited_paper":"/paper/2402.13250","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:57e9ddffb44a0202a24bc7470acef5a7bccae0c23d3a5862c35799def593b916","observation_id":"c69bb0d7-baac-4ee6-80ee-9b06a3803f67","resolution":{"observed_at":"2026-08-06T04:49:38.388595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09590","last_updated":"2025-03-13T17:14:31Z","snapshot_observed_at":"2026-08-03T13:08:09.265147Z","submitted_at":"2025-03-12T17:57:32Z","title":"BIMBA: Selective-Scan Compression for Long-Range Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09590","snapshot_observed_at":"2026-08-06T04:49:38.487988Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.487988Z"},"links":{"cited_paper":"/paper/2503.09590","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:31fc2a014b944ed719fa8c526e5da780aa6cf942bb6b44a6d8d28e49166c1b0d","observation_id":"ada452eb-d963-4838-8da9-cf70e5235c73","resolution":{"observed_at":"2026-08-06T04:49:38.487988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.705339Z","title":null,"venue":null,"work_id":"303d7dd3-de01-4434-920e-d81bf90dc741","year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.592793Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:ad22bac1d4c87d911d6ef8b1807380774e698052331ac2dd798f58f6a8f4d003","observation_id":"f4bcf83e-1057-4518-8e37-70fa5b0f5f89","resolution":{"observed_at":"2026-08-06T04:49:45.734096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T04:49:38.715526Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.715526Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:e0e651c19a564e843b90f406353264f5fc469ff1fba1286737e7b2bf7871432f","observation_id":"3abd9c83-6526-4618-8dd2-b7e698badfed","resolution":{"observed_at":"2026-08-06T04:49:38.715526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:38.819208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.819208Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:2e5d6e7874d7164a5f81cfcda6f729efcd69a90d50b8509bcfa07519a9e04c2e","observation_id":"bb82cd92-7085-45ee-9194-c19c7c338fa8","resolution":{"observed_at":"2026-08-06T04:49:38.819208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:38.925919Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.925919Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:29534270900781684e659d681ac7230f732d184be8d2ee5572af160a79eaa582","observation_id":"a6aafc0f-31fb-4274-a25b-06f213b47ac4","resolution":{"observed_at":"2026-08-06T04:49:38.925919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-06T04:49:39.008817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.008817Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:644a5f631ee545b436ba8da3b80abf516e6d3841123cd061dfcd8206de1670e5","observation_id":"215cecf1-67bb-41ca-83fc-6a30a3038aa5","resolution":{"observed_at":"2026-08-06T04:49:39.008817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.612293Z","title":null,"venue":null,"work_id":"b2ebd96c-9dfa-4fe9-b876-93c1cbfca9ac","year":null},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.090836Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:e86588c657199806d20786a7f2e23b305e8a1f445cb90978337d7654203371e3","observation_id":"880ab0e9-887c-47b5-bbbd-b542464beaca","resolution":{"observed_at":"2026-08-06T04:49:45.656764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05069","last_updated":"2025-03-25T03:46:09Z","snapshot_observed_at":"2026-07-06T20:18:35.429115Z","submitted_at":"2025-01-09T08:44:42Z","title":"Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning","version":2},"cited_work":{"arxiv_id":"2501.05069","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.05069","snapshot_observed_at":"2026-08-06T04:49:44.150069Z","title":"Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning","venue":"cs.CV","work_id":"0aff2327-dcd4-4f83-bbf2-6585f49ac370","year":2025},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.256408Z"},"links":{"cited_paper":"/paper/2501.05069","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:7156b7bf4086fa8d3990fb9ec9bd43d4e2f77a8e764a76b76c6e19a22d155219","observation_id":"4be1116f-7d98-4a42-97ed-97c8dac97951","resolution":{"observed_at":"2026-08-06T04:49:44.268102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:39.355423Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.355423Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:a9344c2a3de0b10d7f93bb4dfa4fb7c1e46ba6d08d9df1eba1090af2766ae857","observation_id":"1fe38cbe-5629-477a-b57f-8a8f54bea77d","resolution":{"observed_at":"2026-08-06T04:49:39.355423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-72652-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:43.076970Z","title":null,"venue":null,"work_id":"5d6ffd91-f964-43db-b0c2-8addc19fce8c","year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.449214Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:499cd357136666466c4774ffcd64588d100f3d9340e89d394573a254915b2cbc","observation_id":"43064c23-18b9-4948-b091-01583c16cbb1","resolution":{"observed_at":"2026-08-06T04:49:43.187724Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.475670Z","title":null,"venue":null,"work_id":"c93aa8b5-9eb2-47c8-8e54-236a085dc0ca","year":2025},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.548025Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:ba5cc78e2458ec2b2da72b21208988128720bd99a8b9ee4c50dd279a6abe88b4","observation_id":"d55e937b-66a2-44c1-97c4-9820b5cc216c","resolution":{"observed_at":"2026-08-06T04:49:45.517323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11107","last_updated":"2022-10-20T10:30:59Z","snapshot_observed_at":"2026-08-03T22:19:37.683430Z","submitted_at":"2021-05-24T06:06:32Z","title":"FineAction: A Fine-Grained Video Dataset for Temporal Action Localization","version":3},"cited_work":{"arxiv_id":"2105.11107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.11107","snapshot_observed_at":"2026-08-06T04:49:43.842641Z","title":"FineAction: A Fine-Grained Video Dataset for Temporal Action Localization","venue":"cs.CV","work_id":"eaf9324d-386d-48b5-923b-52a2ba11d422","year":2021},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.607583Z"},"links":{"cited_paper":"/paper/2105.11107","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:cda683637bad288292c281fa07a17b164e1f4f1dfd377e90165b42d0253b603d","observation_id":"f6d41882-8c87-4c39-8e1f-71d88ac17d0f","resolution":{"observed_at":"2026-08-06T04:49:43.956206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12846","last_updated":"2024-11-24T04:33:25Z","snapshot_observed_at":"2026-07-06T18:33:11.370375Z","submitted_at":"2024-06-18T17:59:03Z","title":"DrVideo: Document Retrieval Based Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12846","snapshot_observed_at":"2026-08-06T04:49:39.709238Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.709238Z"},"links":{"cited_paper":"/paper/2406.12846","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:6e283fa44d0f93f652fb1d7ef397a2e951d366936abb5ed5db132ba99ee644e5","observation_id":"c9ffc015-b9e8-4de1-b45f-f0574edc4c8a","resolution":{"observed_at":"2026-08-06T04:49:39.709238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:39.834064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.834064Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:f4e6d80d0bd93db46f4aac87709c3484d3a086c1d979aca01ad33f7c230fd124","observation_id":"4f84d07b-d150-4a22-a3e6-d5af65ef3d1d","resolution":{"observed_at":"2026-08-06T04:49:39.834064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-07-06T18:10:37.836239Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-06T04:49:40.068720Z","title":"Rawat, and Thomas B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.068720Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:bf1a1535edeb0932c5fa1c2e61c3e0829554dfa11bb4f1d0d19fb6b468847c86","observation_id":"085a55b7-2b21-43a7-8a36-80c70466fbb1","resolution":{"observed_at":"2026-08-06T04:49:40.068720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:40.186187Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.186187Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:f171c6f3453f09cb9f390e8a7965f0442ae95f9f97b508f098eab3ea2a13379e","observation_id":"a6dd47bf-e0be-4ea9-9140-bfcfb4aac0f3","resolution":{"observed_at":"2026-08-06T04:49:40.186187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:39.952238Z","title":"InProceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (ACL 2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.952238Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:78b216ab2955d132b506839b3a08840bdbcf2646c3f9c9de19e072c62d98bceb","observation_id":"58c488f5-236a-4915-8b1e-458f1a1cce65","resolution":{"observed_at":"2026-08-06T04:49:39.952238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:40.413518Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.413518Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:19de5283fda93619451c293988e5a91917e2eb967832dd7eabbc1ccbfc8ed719","observation_id":"e049e15f-6f1d-43c2-b1ff-b5fc0c38de89","resolution":{"observed_at":"2026-08-06T04:49:40.413518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.381577Z","title":"Qasim, R","venue":null,"work_id":"b54b3ac8-4709-4ff6-8303-8c04bbced304","year":2021},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.562692Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:8927503de83428bd4395160887248072df86f1a5fddbb196499d1fc6893a23f7","observation_id":"48bf7a61-c99d-485a-a7e5-114d49c266a4","resolution":{"observed_at":"2026-08-06T04:49:45.411683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-06T04:49:40.297857Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.297857Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:4cf8eb1105ed641c9053b2241b213abc38fe7dd6edc98a637b23043f04fc12df","observation_id":"bfe8e4e3-9465-4421-9f4b-1e4d1c9e580b","resolution":{"observed_at":"2026-08-06T04:49:40.297857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19467","last_updated":"2024-10-10T15:25:14Z","snapshot_observed_at":"2026-08-03T23:56:14.372067Z","submitted_at":"2024-02-29T18:57:01Z","title":"TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning","version":4},"cited_work":{"arxiv_id":"2402.19467","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.19467","snapshot_observed_at":"2026-08-06T04:49:43.501714Z","title":"TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning","venue":"cs.CL","work_id":"3e8d06d7-7faf-4a59-a352-1f0392f4081c","year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.870463Z"},"links":{"cited_paper":"/paper/2402.19467","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:8395bd2ba7e60617e247d9a677ea46153f29f1ca2f62a9584fbca7bd9347fd5f","observation_id":"0404bfd9-8da6-4e13-a968-9f43d86969a0","resolution":{"observed_at":"2026-08-06T04:49:43.602596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01753","last_updated":"2016-07-26T22:49:22Z","snapshot_observed_at":"2026-08-05T16:01:24.330553Z","submitted_at":"2016-04-06T19:56:04Z","title":"Hollywood in Homes: Crowdsourcing Data Collection for Activity Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.01753","snapshot_observed_at":"2026-08-06T04:49:41.021647Z","title":"Sigurdsson, Gül Varol, Xiaolong Wang, Ali Farhadi, Ivan Laptev, and Abhinav Gupta","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.021647Z"},"links":{"cited_paper":"/paper/1604.01753","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:bde6ec759362df3deaa31f68b64d55f7083db74ba6e4f2efe8ba397365bf0e2d","observation_id":"384eec76-6808-4fd5-8fea-1a8de3ccfbc5","resolution":{"observed_at":"2026-08-06T04:49:41.021647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:40.708535Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.708535Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:836cc2acbf593f97cd7e5930252cfca559ab9cd37f79e1ba029eaad44d507305","observation_id":"4d5c72c7-0faa-494f-b3f4-6453f13a14c2","resolution":{"observed_at":"2026-08-06T04:49:40.708535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.236313Z","title":null,"venue":null,"work_id":"61eec6df-fabc-4ad9-a475-304500a480b3","year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.240798Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:2b837ae53e09102bec0473d3ea0cfdbfe501522c8c197884f0fbff48b14dfa39","observation_id":"eb9e33e5-fe94-4d8d-824e-90f52617c15d","resolution":{"observed_at":"2026-08-06T04:49:45.322353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T04:49:41.380659Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.380659Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:9e1acd97a485daaeafa68ba874e53ce96a5f2cb4c51e946220fde558169fe668","observation_id":"cdb02b9b-67d9-4830-be24-be0b0b3b54f8","resolution":{"observed_at":"2026-08-06T04:49:41.380659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-06T04:49:41.124471Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.124471Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:584a23b847d1acb2e7df324dcd420d242273e37b57911ed2e7dcef396d5366e6","observation_id":"0dd44e4c-e53b-44f3-be17-484d8fd9ff9b","resolution":{"observed_at":"2026-08-06T04:49:41.124471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.134927Z","title":null,"venue":null,"work_id":"8955293a-770d-4880-bc5f-aa9a6364f54a","year":2021},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.636346Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:3c0235938c1a51e7b9227a1398e61d95e5fc23ac8ee31d8f20978ab84da0eabb","observation_id":"72be860a-0026-4722-bb6d-14242836a9c7","resolution":{"observed_at":"2026-08-06T04:49:45.166685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-06T04:49:41.776592Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.776592Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:0671609354043c0c8af9d996f91124c59ff47b9502659dceb8ef16092f9c12e4","observation_id":"28fd947c-bfe8-4d0b-8954-e19b2f9e491f","resolution":{"observed_at":"2026-08-06T04:49:41.776592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-06T04:49:41.523576Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.523576Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:885e3d161bf0b34866542cd6b6f3cd3e8cc25ec9a7a719ce28bb7dbd39bc033c","observation_id":"2ac3d27f-7c44-4e0a-be78-6d8ba40ee92e","resolution":{"observed_at":"2026-08-06T04:49:41.523576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-06T04:32:16.849942Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-06T04:49:42.003797Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.003797Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:d75d077b92be88a16bde4e1dc08b99c30ef05d2450b4c446ec19ed2c1fc9d312","observation_id":"20751638-ba9e-4f60-84aa-533399259549","resolution":{"observed_at":"2026-08-06T04:49:42.003797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-06T04:49:42.097293Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.097293Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:079c751bee2aa21b20e5d072bec248907b30dfdd3939d9f55d747cab5c925c50","observation_id":"7633f68b-5142-46fb-be42-0dcf7ba2cfcf","resolution":{"observed_at":"2026-08-06T04:49:42.097293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.059490Z","title":null,"venue":null,"work_id":"eab67c7a-82b3-45a9-a576-e502b6a05ffe","year":2022},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.911771Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:c7cfca1b1833ee0cc6cdab356a8ba503d544f7951466e3594a10545a56c64418","observation_id":"0f9d426d-bf5f-4d1d-a70a-ea7ea25b8dd6","resolution":{"observed_at":"2026-08-06T04:49:45.086855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17235","last_updated":"2024-10-10T05:17:00Z","snapshot_observed_at":"2026-07-06T17:09:24.271573Z","submitted_at":"2023-12-28T18:58:01Z","title":"A Simple LLM Framework for Long-Range Video Question-Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17235","snapshot_observed_at":"2026-08-06T04:49:42.312571Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.312571Z"},"links":{"cited_paper":"/paper/2312.17235","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:b2249c8ede5481f87d6e20bb5f08fc19d365782943d4b4d6859534cb8177450f","observation_id":"34e11361-29a3-4833-90e7-58ddcf13c67e","resolution":{"observed_at":"2026-08-06T04:49:42.312571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T04:49:42.423364Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.423364Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:5b4960412306f208955d80a8eb7e8941cf43c94d4b776ad6a33776e8c17a5123","observation_id":"e28f971e-4ef0-4741-b281-96adc07bbee8","resolution":{"observed_at":"2026-08-06T04:49:42.423364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06988","last_updated":"2023-11-29T21:24:35Z","snapshot_observed_at":"2026-08-01T23:38:14.619200Z","submitted_at":"2023-05-11T17:23:00Z","title":"Self-Chained Image-Language Model for Video Localization and Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06988","snapshot_observed_at":"2026-08-06T04:49:42.185509Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.185509Z"},"links":{"cited_paper":"/paper/2305.06988","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:e7893b2c1ef7668307b57716def0cd462ae9e9a29b6ab302744e284c2b9b1d5c","observation_id":"0a16f30d-b100-4137-849c-bc3eb44ebdfa","resolution":{"observed_at":"2026-08-06T04:49:42.185509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.09374","last_updated":"2019-09-04T07:35:48Z","snapshot_observed_at":"2026-07-06T06:16:08.829992Z","submitted_at":"2017-12-26T19:09:11Z","title":"HACS: Human Action Clips and Segments Dataset for Recognition and Temporal Localization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.09374","snapshot_observed_at":"2026-08-06T04:49:42.667270Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.667270Z"},"links":{"cited_paper":"/paper/1712.09374","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:c8bdcf503c7fb90dbf54dd0674c8675883f0b2f159bf08c410a8a7f6ad222c48","observation_id":"9efbab19-1769-48cb-9f6a-b522e115e48d","resolution":{"observed_at":"2026-08-06T04:49:42.667270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:42.770981Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.770981Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:e43cd6e271907897a476d88ec66bc13dd5435652f26dad6db54e8871fa1bc51c","observation_id":"22477e2d-58ab-4c4a-bd9a-878b1ce5b9da","resolution":{"observed_at":"2026-08-06T04:49:42.770981Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:42.523814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.523814Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:ac8c7bcb8e7d24fad09bd414782d7c00521f91e2681091a836627d1df8dbb815","observation_id":"274ddc68-04d3-4e29-b61a-c2eefc215d8d","resolution":{"observed_at":"2026-08-06T04:49:42.523814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:44.929132Z","title":null,"venue":null,"work_id":"ff907073-4a9e-4bb6-bf71-c821205b87f8","year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.909084Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:96acd02e256e9d732414e16768305ca5a49f281e5fa098138a46667d2d865a4c","observation_id":"bb1fe118-e6d6-4eb4-a643-551b0be153ba","resolution":{"observed_at":"2026-08-06T04:49:44.985780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.814303Z","title":"https://api.semanticscholar.org/CorpusID:1710722","venue":null,"work_id":"6b257484-fc84-456e-b22e-00b184487532","year":2015},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.295335Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:33d896077437384a7a66bdbd765340df1f794da46501aa40ff6a0d3381f3a009","observation_id":"ea88ecab-50cd-4258-909f-1cbeec8dc364","resolution":{"observed_at":"2026-08-06T04:49:45.879225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-04T15:53:11.168523Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-06T04:49:39.159644Z","title":"https://api.semanticscholar.org/CorpusID: 270559556","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.159644Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:ecd4ab9bf535262dc7f68121e31472e10363eae53b63fdc60d7185c45955f807","observation_id":"7d166b95-e89a-4822-9a73-8309863d4e2a","resolution":{"observed_at":"2026-08-06T04:49:39.159644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T04:49:36.808571Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":44,"verified_exact":4,"verified_fuzzy":2},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2508.03039."}