{"as_of":"2026-08-05T19:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b4d6b517fc44c829f0e10c9d401166fe0c92fbd33bff5fc34fbccc92d543b22","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T05:01:06.299758Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T08:41:42.061219Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-11T20:31:13.191851Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"cited_work":{"arxiv_id":"2501.14194","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.14194","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","venue":"cs.CV","work_id":"18b7c23f-d2a1-4fc6-b98f-40f831e6afd9","year":2025},"citing_paper":{"arxiv_id":"2604.23145","last_updated":"2026-04-25T05:07:43Z","snapshot_observed_at":"2026-08-03T01:16:00.979324Z","submitted_at":"2026-04-25T05:07:43Z","title":"UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T08:41:42.061219Z"},"links":{"cited_paper":"/paper/2501.14194","citing_paper":"/paper/2604.23145"},"observation_digest":"sha256:9adeb3452996cff4cf45230dd154a6c0c35df14210f4bdbf714d22c8b73120a2","observation_id":"e091819e-610d-4270-a066-990a1831f0e7","resolution":{"observed_at":"2026-05-11T20:31:13.198639Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.14194/citation-record","integrity":"/paper/2501.14194/integrity","json":"/paper/2501.14194/citation-record.json","paper":"/paper/2501.14194"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural module networks","venue":null,"work_id":"6e9ff79d-d176-45b1-bd6d-948f1a02a442","year":2017},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:ea4dea9d18f25e8f2f5ded0be2746c384c24da5c43866b50127b15bdd0dfa9a2","observation_id":"d07d8b03-e851-4f23-96c4-c44d70652789","resolution":{"observed_at":"2026-05-23T05:05:24.990893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hiervl: Learning hierarchical video-language embeddings","venue":null,"work_id":"0268f0c0-bd7c-4696-8bcb-1fcd1948b557","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:31e8c80e58abfec58a47b9fc2b8b4bd3475bf1175a045409011eb21f60ea0e57","observation_id":"8699864a-d3a2-4c52-a355-91571959b530","resolution":{"observed_at":"2026-05-23T05:05:24.994488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"208b3b06-1644-4c83-8117-629ff3df1ce3","year":2020},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:661ad70b609fd28dde404ea8d5d22df4f66b92d6cb4a6e1c8413c5a6a275a4e5","observation_id":"de589788-3fb3-4e9c-bb5b-9447450f977e","resolution":{"observed_at":"2026-05-23T05:05:24.985455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounded multi- hop videoqa in long-form egocentric videos","venue":null,"work_id":"0868c81b-b149-46be-8d5f-ca68fe12d418","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:f46343b8ccd5502c4c51478b53b6c1d47061404564c66d30bb5e6ad2c35812d3","observation_id":"6a054b05-a283-419b-bd53-51d98f322e95","resolution":{"observed_at":"2026-05-23T05:02:37.270670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kitani, and László A","venue":null,"work_id":"3d9db89d-c353-4af6-9673-bdef2fc02526","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:1001e601efb17332bd5236d56c882c39270d964d83500b947962995c0f747a36","observation_id":"d32f3b1f-6ffa-46ce-91fd-e4dae113264e","resolution":{"observed_at":"2026-05-23T05:05:24.988331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The llama 3 herd of models","venue":null,"work_id":"0351731f-2700-4a9b-a555-ea0b667bda8a","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:0e37e32bbe72c18d316dd223ec11045cc65ed484b52e2b7af7c0ebd91761084c","observation_id":"6e6bd0ec-03a1-4329-b41a-038edf6a51d9","resolution":{"observed_at":"2026-05-23T05:05:24.979794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoagent: A memory-augmented multi- modal agent for video understanding","venue":null,"work_id":"304c1528-a107-46f5-9c44-fe39cba32589","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:24339506d3671334ebc18122df39264306f1decdb5877c86b324405e6501e1b5","observation_id":"15544bb3-8e15-4064-aece-eaee78c0082f","resolution":{"observed_at":"2026-05-23T05:05:24.997794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"2e28d9ce-e3bb-4399-9879-cbe6c3e58731","year":null},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:ef56922a1808770c36f3bd6ba121a2c18f7cf4a3022d9f54ae5805b3c55e2cf9","observation_id":"ddef7a3a-d5c7-4f5c-b674-2fa461a00acb","resolution":{"observed_at":"2026-05-23T05:02:37.274890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":"f08a24da-ab89-4763-b214-3b02f7e51159","year":2022},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:5b425e9a52ff2fa6e5e623a3a72731114052961e833732aa194f7502c059342c","observation_id":"dc1f27ce-957e-4b37-bedc-182de65930f0","resolution":{"observed_at":"2026-05-23T05:05:24.982429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Free video-llm: Prompt-guided visual perception for efficient training-free video llms","venue":null,"work_id":"28752f60-8d13-4591-96aa-c26eee65d375","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:120c5b9834fb478e1941a063e70b8b13c4016770ccbcf3ad4edd040a77d04a08","observation_id":"e990e8d3-d1ea-418f-b7ea-f5a5329c3250","resolution":{"observed_at":"2026-05-23T05:05:24.949958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video recap: Recursive captioning of hour-long videos","venue":null,"work_id":"ea4cb063-a789-49bc-83b1-27bf48812e68","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:f53f88435d0c10e4eecb97858cc7accf835d9a1da1490746eeb616315239e1ee","observation_id":"896c9d79-5826-414d-8021-02c1fa92a8e5","resolution":{"observed_at":"2026-05-23T05:05:24.982252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c00ca963-27f4-4110-941f-1eb75c74f8af","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:cf07453f6c1aec9b097df0a550232264f89138869bd75ed2f5629c657790a694","observation_id":"cd80d71d-2e03-4afb-b129-522ffd695730","resolution":{"observed_at":"2026-05-23T05:05:24.911485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intentqa: Context-aware video intent reasoning","venue":null,"work_id":"e7e83c95-74ad-483c-ba8c-fa55acdf4273","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:9abf97061f537c7b6fac94084ca576af819624c4772c326bd74c24cdf51c5eb4","observation_id":"90b8005a-a565-4389-80dc-f0838b7a2a14","resolution":{"observed_at":"2026-05-23T05:05:24.946657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intentqa: Context-aware video intent reasoning","venue":null,"work_id":"672520cf-54ef-412c-9b41-95488ab50e49","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:ec17272f4a08e314c14674ff2b48a72d2781556f23bbe2aa51391ac0d4c08757","observation_id":"3171786e-4afe-40f0-815d-4b0b656c054d","resolution":{"observed_at":"2026-05-23T05:05:24.952755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":"2a405a5a-6cfc-4bbb-b76d-e1a45cd1c5c7","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:f0a32896cfb96631370e2376dc0cad0aee8c5a3cfd5dc351ea0b29528be47704","observation_id":"b15977f6-c395-45a1-8392-193ebd2a4982","resolution":{"observed_at":"2026-05-23T05:05:24.936590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"551a0931-6aa1-4002-ac92-4e5141b422f8","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:77e0e6703f82fa063872d58a7b7dadd91b5fd8469c04f67223b52cb2d9fa0ab8","observation_id":"9440fa02-5773-45f2-b853-e3c76e922f59","resolution":{"observed_at":"2026-05-23T05:05:24.956512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end video question answering with frame scoring mechanisms and adaptive sam- pling","venue":null,"work_id":"4a0bb89a-e323-4588-adcc-de8915a84120","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:47ba0d87944543ce960348c25d5b7581b1ab218e43a0771e0a7764d66765b197","observation_id":"58dc5d70-4ba1-4ab3-ae60-dec492c3812e","resolution":{"observed_at":"2026-05-23T05:05:24.959343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoIN- STA: Zero-shot long video understanding via informative spatial-temporal reasoning with LLMs","venue":null,"work_id":"5c3e794f-1351-4989-8def-68e60073b33d","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:43dd1588991e8d50c558bf0fc532c04d19b5b0d3cab5ab45e5193d5db6d3539b","observation_id":"c6ea5862-fb7a-4aef-a489-18ff8209eaef","resolution":{"observed_at":"2026-05-23T05:05:24.937177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vx2text: End-to-end learning of video-based text generation from multimodal in- puts","venue":null,"work_id":"4605e6b4-37ff-44dc-894c-06ec6a9de93c","year":2021},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:05a6a51b3edd2596e18e1a2a4e7639c4d6b3da81a8d5b7ebd8db51b78cb7719e","observation_id":"c5a1ddf9-00b0-4bae-a3aa-e0dfa638d972","resolution":{"observed_at":"2026-05-23T05:05:24.939673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards fast adaptation of pretrained contrastive models for multi-channel video-language retrieval","venue":null,"work_id":"26aad059-618b-449e-b58b-cf24a8867e26","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:4229a561a682f3ad4e179e32700cbef0a1e4e065809a4be4e15c56e2fed02c3d","observation_id":"a5be5e2c-e8a5-4970-88e5-a648e50a850d","resolution":{"observed_at":"2026-05-23T05:05:24.873754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training-free deep concept injection enables lan- guage models for video question answering","venue":null,"work_id":"4e7f8bdb-ded6-494b-8fd7-1b29b8166aa6","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:db737ac54a21621f3a881512c060aea26191451a29e5e2e7f202469887aa5693","observation_id":"f7d45b12-2098-4069-a197-646927d4d0bd","resolution":{"observed_at":"2026-05-23T05:05:25.030597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hair: Hierarchical visual-semantic relational reasoning for video question answering","venue":null,"work_id":"31ba1b12-c227-44db-b127-8b866d3425c5","year":2021},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:538a30f7afb0c580b1420b8b544f48933ce7c4ddb38a4f4d32f36865c4ead443","observation_id":"be98f818-536d-411e-b3a8-5d232fa30cdb","resolution":{"observed_at":"2026-05-23T05:05:24.922613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"11f8e9da-1d99-43d0-8c89-2751b56f73e9","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:1eb684c64b454d1a238e0e165efffc3bc65c67af6c1fa7a5dce9af1df79b5c7a","observation_id":"44b67fe6-a40f-441f-9a58-bcf85655c5dd","resolution":{"observed_at":"2026-05-23T05:05:24.926521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"bde1f2f6-af1a-412c-9b84-66d0146a9872","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:d2d53590f06687d0f1283e3488e5d6faf49f0e7210f88820f2a4f03d283fb272","observation_id":"65fa6e4c-3285-4513-b444-d4ea0482cf19","resolution":{"observed_at":"2026-05-23T05:05:24.919876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Morevqa: Exploring modular reasoning models for video question answering","venue":null,"work_id":"dc2a3ed1-e7e7-412b-9c52-fe9aaad8b7ed","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:120f4d3289291b0717000072f5e170d30f16791b0abc70b68b07ffd8fbbac3a7","observation_id":"00c61d5e-95d3-4662-9a73-c563c5fe94b4","resolution":{"observed_at":"2026-05-23T05:05:25.033628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Question-instructed visual descriptions for zero-shot video answering","venue":null,"work_id":"c872aa20-119e-4d42-8d04-6b19d9fc56d3","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:5080a07c45255df4eea9aedad558c186b733fa241e2ee90e4362de184cc4e1d3","observation_id":"7f61adff-ff87-4656-99b4-fc396cff212e","resolution":{"observed_at":"2026-05-23T05:05:24.988970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08835","last_updated":"2024-07-03T18:05:02Z","snapshot_observed_at":"2026-08-04T18:08:42.450729Z","submitted_at":"2023-11-15T10:22:35Z","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","version":4},"cited_work":{"arxiv_id":"2311.08835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08835","snapshot_observed_at":"2026-07-04T03:29:31.161365Z","title":"Correlation-guided query-dependency calibration in video representation learning for temporal grounding","venue":null,"work_id":"930bf918-21bb-485f-a9a4-7951c1ac3b74","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"cited_paper":"/paper/2311.08835","citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:27180608a2e7ae24b38049b2067df6d2642c5f6f1d83d6e7852ee9ad8419d6eb","observation_id":"d4485737-3411-4d71-bbf1-95e07bf34cb8","resolution":{"observed_at":"2026-05-23T05:02:35.938663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4 technical report","venue":null,"work_id":"048f6ec9-d811-41af-b975-0a8753b5053e","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:bfbfd69c4bd8842e54a7f934a0c684470e467e4ae676bb0ac67b84fbc31b7bc4","observation_id":"af6a8a11-0812-44d9-a385-0462a68822e6","resolution":{"observed_at":"2026-05-23T05:05:24.962422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieving-to-answer: Zero-shot video question answering with frozen large lan- guage models","venue":null,"work_id":"b20c4f58-f1f4-4885-84cf-c75191aeae2a","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:5fdbb462e8f07da9a82af5f7812248ab369e0a4c0f6c409685cdebda16c84ca3","observation_id":"594ff0a8-6fc3-4906-ad49-cd492f120dad","resolution":{"observed_at":"2026-05-23T05:05:25.012879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dc8afc3f-fa20-48ac-ac0e-2f9303b6c201","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:56660e4ba47f87229224f5c742ea996dd804a75ac61dea1caf2cc0e540d91678","observation_id":"be66a808-9b32-4fbf-9d6e-ec488c361027","resolution":{"observed_at":"2026-05-23T05:05:24.949307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Micap: A unified model for identity- aware movie descriptions","venue":null,"work_id":"4bcdabd7-6424-4ccd-9d6a-4964f4079fb7","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:2c7e706344e0233554a9d8897818cf719374c1a9dcc609a4d9e0f9001b4898e9","observation_id":"07ac8de7-76db-47f6-a70a-6b9171a03db6","resolution":{"observed_at":"2026-05-23T05:05:24.979491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Traveler: A modular multi-lmm agent framework for video question-answering","venue":null,"work_id":"f2117b01-70a7-4725-8f5f-4d57d91bdae8","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:47bae242d824fa9c39f9a37d5579bd5c9fe9db2fc6ef1b2c770cbacefed02c8c","observation_id":"b9e2e6c4-83a0-4678-9b8e-e55ca3d93f79","resolution":{"observed_at":"2026-05-23T05:05:25.027244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoorthi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":"e4dd8e58-4b0b-4ab4-96c5-42a355399618","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:796e73d69d901bf6490b9b4977a0558c25b4bca656ec6a15a2faa95749153700","observation_id":"dbd6406f-eede-4283-87aa-2c0473cbc8fe","resolution":{"observed_at":"2026-05-23T05:05:24.929695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Progprompt: Generating situated robot task plans using large language models","venue":null,"work_id":"a1549f0c-695b-4ca5-9fc7-36f0d05856a6","year":2022},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:6bdc58c968891d939358b78c7d7d7efb5eaf59e5b204e36bac4950c8e54c2aeb","observation_id":"a905d258-c2e8-4213-91e6-089eb8141f0e","resolution":{"observed_at":"2026-05-23T05:05:24.992579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"dfea0eef-72c3-4242-8a69-5418e4b59a70","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:d43900be2a5c095db54e326f9ee337d4f41be96abf621fb45e43eb9fde83dfad","observation_id":"635f295a-feae-430a-b6c7-081446c85ff8","resolution":{"observed_at":"2026-05-23T05:05:25.009653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modular visual question answering via code generation","venue":null,"work_id":"b41c4cc5-f2c9-469e-8bdc-b8e589d20ca4","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:608ace6cb672eff5a4aebe928aef3b2b907144168d14f55e0001682bccb9811a","observation_id":"dab82b8d-8f7f-4d33-b091-7e7b9e46447d","resolution":{"observed_at":"2026-05-23T05:05:24.870947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"c65b2c6a-9e6a-4aee-a6ea-f99661158e7a","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:98e74a0580f2e8a6437419dc01751f3aed304be9582271045bde8666df2a363e","observation_id":"1facce90-297f-455a-a708-7ea961c17ae1","resolution":{"observed_at":"2026-05-23T05:05:24.965623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"7769bd4f-5d24-4745-8d1b-1b9ded0a5b3f","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:6cf4a1ddee340ab053eb36f5e180d5ebfc0bb43aa37c3740f5267cd4226a1965","observation_id":"9099eb23-eb5e-4ff5-9e9e-b47ebb119794","resolution":{"observed_at":"2026-05-23T05:05:25.006658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":"65eab0c4-beb8-40d2-8c8e-9b8f5f1a2b0c","year":2022},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:e007414e3e6be972315261b345f41d736e79fb6cad5579866ee4e42f7bd0229f","observation_id":"9a661515-dfdb-41d3-9f13-36c6a28d6340","resolution":{"observed_at":"2026-05-23T05:05:25.016989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stair: Spatial-temporal reasoning with auditable intermediate results for video question answering","venue":null,"work_id":"e15108c4-ba84-430c-8a4e-13c201f2e3b6","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:b87811edf149434e6060521a1ce82309952853b2946631694567c9a0327b717f","observation_id":"49b4b98c-63ed-4160-b8e6-65a74784b721","resolution":{"observed_at":"2026-05-23T05:05:24.881287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":"f0515890-d05d-418f-a4d8-69d247645431","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:ca32cae0ca31cf4c13c674cc89f396d2fb364f8a390c3586369080fd42f645da","observation_id":"8771a3d3-480f-4c70-b78c-9842f3196bb3","resolution":{"observed_at":"2026-05-23T05:05:25.023611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Freeva: Offline mllm as training-free video assistant","venue":null,"work_id":"557cc9ae-5153-4016-8bea-4cb39c4011d7","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:fe9c14062a0e77a351c5045eb5f12de25ee80f724e9c5c8af332a25917d537ac","observation_id":"be423fa0-f946-4500-907f-1795e19430c9","resolution":{"observed_at":"2026-05-23T05:05:24.995907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Next-qa:next phase of question-answering to explaining tem- poral actions","venue":null,"work_id":"73e4408e-777a-4f5d-8a1a-332fe3b20d2e","year":2021},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:fd9451bf2f28d3ff501f8a534c65f5b1edd6599b4c38a2637f69422970bc7475","observation_id":"b2282c50-4b72-46c9-9da6-e55757e63cff","resolution":{"observed_at":"2026-05-23T05:05:24.976858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Next-qa:next phase of question-answering to explaining tem- poral actions","venue":null,"work_id":"251ffc7f-da98-4a14-bb17-f7ea8d8e906d","year":2021},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:5b8eea9d844e8c06b053ed0e51ddbdd0179a8098d1f93a535205ef85432cd38d","observation_id":"775fe7ea-d826-41cc-933c-ec4acb7e6195","resolution":{"observed_at":"2026-05-23T05:05:24.955730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slowfast-llava: A strong training-free baseline for video large language models","venue":null,"work_id":"000d715a-28d0-478e-a5d8-dad0e6673215","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:2d0bed9a3815aeb8537bb8324213a3b588e87c020781deb33846d711110b9717","observation_id":"660226c7-617c-45c3-a678-7215f34516a9","resolution":{"observed_at":"2026-05-23T05:05:24.969341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panoptic video scene graph generation","venue":null,"work_id":"4b789961-8543-44db-ba27-cfb963c8a187","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:0145b4f3cedffb7cb7d2f49a57cf2013aa3db9560536dc8ea42b5c40fa064b52","observation_id":"5e76f76e-502a-4372-948e-95ed9fa1725a","resolution":{"observed_at":"2026-05-23T05:05:24.999054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action","venue":null,"work_id":"a7fbf27a-e7be-4f5a-9f25-457fbc4834dd","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:ec3feffcc0f6337e1904df79a89b3e4db67179d89db7e21e694a954c73a75149","observation_id":"31b81c97-78c9-4879-9f44-5ce2586c6d0d","resolution":{"observed_at":"2026-05-23T05:05:24.959141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ayyubi, Kai-Wei Chang, and Shih-Fu Chang","venue":null,"work_id":"5392da26-6cce-4e42-bab8-04f1fd152f94","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:f2eda74e7a8c99d3ba43f8d8ab0d880e5f93344323198be361a3bfeeb36dae72","observation_id":"54c34af3-7868-4e7b-9ba1-0e3e9e8c4dbf","resolution":{"observed_at":"2026-05-23T05:05:25.003171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"0658c4dd-80cb-410c-9ce8-41a6bb682bca","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:a61bbac187016532219da3ca84cdb64d2fe8572ce00ee0dc1759f99e0f3e46a6","observation_id":"9bf4f48a-f555-4c4a-bbe0-fea2236f7e89","resolution":{"observed_at":"2026-05-23T05:05:25.020206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"39747006-a849-4a89-a155-411592b470c0","year":null},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:c037c16b72675b086a11be20f360f23008774cd9ad40ae5345d27caccd1c2a51","observation_id":"c1a98543-ef4a-4ec6-be37-0ba32ee7884c","resolution":{"observed_at":"2026-05-23T05:05:24.975881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple llm framework for long-range video question-answering","venue":null,"work_id":"9aeca149-b2ec-4591-8299-b4e86d16104c","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:c0705f10167287b4c8cff72ca7a3214e7e53005ae10f682a6b0cec39f40e02b1","observation_id":"0566ea3d-888b-49b9-9fe6-484a693fc0b0","resolution":{"observed_at":"2026-05-23T05:05:24.962199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple llm framework for long-range video question-answering","venue":null,"work_id":"cb37f4cd-c85c-42fb-b4bd-8b8785a976f0","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:f5e727eb980d178db2a9872dbc91027eac5aaa5060bfffc07ba1427c99ff0a3c","observation_id":"50ebef7d-9e3f-4eae-bf1b-6ce8e5466c5d","resolution":{"observed_at":"2026-05-23T05:05:24.968679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":"e1c3e01b-4434-45d7-8402-3f9b93c6ef74","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:26aaa79df5c5bc1ccced7a992b03415137f0eb7fee832e27eb058666e6adb008","observation_id":"1dc9fa09-9994-4065-b641-d050ffdbabe1","resolution":{"observed_at":"2026-05-23T05:05:24.985768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Base\" component refers to cases where the generated code operates without triggering addi- tional modules like the","venue":null,"work_id":"c7b713f6-8450-4eca-ad08-43a9f7685a85","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:9b08de375f51dd177f99e1e38eb9c738a6b86e2be105aaacca13b903f3572c1c","observation_id":"a4353d16-04fb-4e7c-81b0-313e5c1399cf","resolution":{"observed_at":"2026-05-23T05:05:24.972387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T23:50:48.129853Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":1,"verified_fuzzy":50},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2501.14194."}