{"as_of":"2026-08-22T22:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3937fe3603212f5a36220986e67439ffbaa606f49bb9fb9c9714db964e7735c9","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:36:17.742562Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:26:49.679168Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T13:26:50.220608Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"cited_work":{"arxiv_id":"2507.18552","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.18552","snapshot_observed_at":"2026-08-06T13:26:50.220608Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","venue":"cs.CV","work_id":"b49f0c2e-7095-4e59-b39c-faec7cf0d500","year":2025},"citing_paper":{"arxiv_id":"2608.04939","last_updated":"2026-08-05T15:06:03Z","snapshot_observed_at":"2026-08-15T03:44:31.356780Z","submitted_at":"2026-08-05T15:06:03Z","title":"Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T13:26:49.679168Z"},"links":{"cited_paper":"/paper/2507.18552","citing_paper":"/paper/2608.04939"},"observation_digest":"sha256:f90044256237c9c5d0de69afd141c2c564503479c3014c0403f3f7eec79f0aaf","observation_id":"6eda65ef-6e64-430e-9cbf-91f7bee17e5c","resolution":{"observed_at":"2026-08-06T13:26:50.225809Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.18552/citation-record","integrity":"/paper/2507.18552/integrity","json":"/paper/2507.18552/citation-record.json","paper":"/paper/2507.18552"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.669298Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.669298Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:156d0a8ef7e16fd87318e459a22d4b5721add7594e263bac3b501819fa72705d","observation_id":"dcb6ff57-d4c4-4983-902c-364342c2f332","resolution":{"observed_at":"2026-08-06T14:36:17.669298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.937218Z","title":null,"venue":null,"work_id":"64d5928f-f45d-49ec-898e-f7845351da89","year":2011},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.672416Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:017bd6f1440cee229af1ce7d554ff81fbe279c952ce69f91b367b13aa078df07","observation_id":"c3035e13-6f62-40a2-9792-0eb942947abb","resolution":{"observed_at":"2026-08-06T14:36:17.940088Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.928692Z","title":null,"venue":null,"work_id":"5d96c9fa-0f79-418c-9498-717314ba33bc","year":2024},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.675479Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:3d8f7d3284bd0c8d70a327a53a41436c88a0c71ad63c89898f48722fd4cd6cc0","observation_id":"207c1d92-d5c0-4ce3-99d3-cb6b3e437068","resolution":{"observed_at":"2026-08-06T14:36:17.931333Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.920030Z","title":null,"venue":null,"work_id":"819dce4e-81f1-4b76-ae23-176b1b39373f","year":2025},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.678374Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:d094c0c59a5425bad72216f31a990ed393fb17dad2e553916548504c2f3d4679","observation_id":"1c1d00f3-a256-47e3-8b6d-0f04d9b0a1db","resolution":{"observed_at":"2026-08-06T14:36:17.922870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.912608Z","title":null,"venue":null,"work_id":"d333305e-3c0d-41bd-a2ab-0a940dea239e","year":2022},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.681472Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:3dbfe2360e5807c09e9a0168761cb3d51662b2e280588ed17ef030144617656c","observation_id":"3b5435fb-640a-465e-92ea-ecc13e6519cc","resolution":{"observed_at":"2026-08-06T14:36:17.915323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.684196Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.684196Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:8e9923e66366c53a4f198c068a4532c34621602835ec9909deaaed178318abfe","observation_id":"140b7de1-be6c-4bf6-bac1-ff3acd5307e3","resolution":{"observed_at":"2026-08-06T14:36:17.684196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.893310Z","title":null,"venue":null,"work_id":"8c7a13f0-c9a0-47a0-b27f-deda2fa578d1","year":2023},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.689452Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:5a546848908d5c4962d832f88657a39162b2b70b72769b2e445e131a823beeb5","observation_id":"ccec6382-bb75-44ad-87ad-bca9a277fb83","resolution":{"observed_at":"2026-08-06T14:36:17.896004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.885749Z","title":null,"venue":null,"work_id":"1913fb55-d713-4831-8458-33328bcf9e7e","year":null},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.692137Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:730ed30a856dfaf0dfbef3fe5b29dd2859ce12bd79d9166859964dc199e23bba","observation_id":"fc12e226-4896-44fc-832f-dc33d30f9289","resolution":{"observed_at":"2026-08-06T14:36:17.888389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.698429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.698429Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:85f75d60090dc19d6881869352f6c65e01d73af505289037ee794f02217e5cca","observation_id":"82d745f7-4377-4fce-8909-bcd39332254b","resolution":{"observed_at":"2026-08-06T14:36:17.698429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.865058Z","title":null,"venue":null,"work_id":"6e2a9178-9075-4879-bd83-3d24c839c0b5","year":2024},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.700991Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:78db04d43e4790e977a67c0cce074064d85d013a481554f3f93574496ec4866c","observation_id":"51b9c1ad-c75e-4ace-8554-3329c6a693c8","resolution":{"observed_at":"2026-08-06T14:36:17.867816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.857792Z","title":null,"venue":null,"work_id":"ff3ba7de-7cef-4b23-87a0-0681ebf4bcdc","year":2019},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.703583Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:b1afb4ce8dacbd83cba11de3b6226c1b2f0ceb63fc9330466ecb28dc3fd29781","observation_id":"52fa79b7-9c94-4e00-9ebf-fc75278eeb70","resolution":{"observed_at":"2026-08-06T14:36:17.860421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-06T14:36:17.706991Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.706991Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:bf193eb1d3c2ea176080a6df54413a7e0ce982a5dff199d2675c909a7f37a844","observation_id":"8c2a5f34-8d74-4e9e-aee1-f01d811fa393","resolution":{"observed_at":"2026-08-06T14:36:17.706991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.849814Z","title":null,"venue":null,"work_id":"650ba803-e52d-4689-bf48-93a4b709cea0","year":2017},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.711139Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:e7c918a726cba7a7536815a03a668334d95d58b21c70dd5166692089ed7168bd","observation_id":"a595082c-c994-44b3-bec5-4db5b5050eca","resolution":{"observed_at":"2026-08-06T14:36:17.852279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.842501Z","title":null,"venue":null,"work_id":"5088297e-cc33-4131-bb70-5f23f1839829","year":2018},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.713694Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:d649cf64d477224e70c2e477e7c1be65c6c92a6c4388a73f21a07e4987ea10f5","observation_id":"1d3e9038-0a5b-4ea3-b712-bd4efdeffec1","resolution":{"observed_at":"2026-08-06T14:36:17.845087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.716107Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.716107Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:04ac91cedd41c7117f8c294ad51303001a27f1cf293065a7d90491983edd41f0","observation_id":"4eb03fb5-9f1f-44ee-a19e-f3889548655b","resolution":{"observed_at":"2026-08-06T14:36:17.716107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T14:36:17.718956Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.718956Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:b498e872424424de91046eb99a4148ef4966af7588f53399392f058358666dd7","observation_id":"48d14979-6788-41b4-a8dd-8520ce911b75","resolution":{"observed_at":"2026-08-06T14:36:17.718956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.831184Z","title":null,"venue":null,"work_id":"ef2dcc19-928b-4e9e-945f-101ecd01642d","year":2019},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.721605Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:426809e1d7562381744dbe2cf74faa15c61e3a774301a9a78a61bc66e023b2d6","observation_id":"c72c969d-f1a1-4537-938b-8c0820829b92","resolution":{"observed_at":"2026-08-06T14:36:17.833880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T14:36:17.724007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.724007Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:1184bea92c99934a5471dd4b6eee517e7b6e4d8c2d39f0dc80b9e042332af59c","observation_id":"3d0b065b-b671-4a08-90de-556ab4257c7a","resolution":{"observed_at":"2026-08-06T14:36:17.724007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-08-19T18:30:11.337554Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T14:36:17.726835Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.726835Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:e3c1a020f22f4574d8c474a91a51aca515e84884af4a1a9ea6385d2bcbd0ebbf","observation_id":"2228c1a3-fef8-4a05-9d27-bde4302af7f0","resolution":{"observed_at":"2026-08-06T14:36:17.726835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.823342Z","title":null,"venue":null,"work_id":"6302b758-f669-4dfe-a56f-fee8d47aa94f","year":2023},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.729874Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:b0156c4c946583510ab5921baa8cbdbaefd294217b8ef5499b15cbbce3298dec","observation_id":"d8e201cb-3c24-403c-9741-f9b85f9d0127","resolution":{"observed_at":"2026-08-06T14:36:17.826001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.815563Z","title":null,"venue":null,"work_id":"2dc28c36-315c-4173-bb2e-62d85e42679b","year":2016},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.732305Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:07ef264cdb9421b28031d040140978e803b96e6f6b1754adfd1f0aa8d4f987ba","observation_id":"defe94cb-2268-4054-a089-90505a5b28ea","resolution":{"observed_at":"2026-08-06T14:36:17.818364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.735208Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.735208Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:2d5d1703b35519c5fbb0f918c1a7970bf8a935d341dc1991e784234fab254b7b","observation_id":"1093e8d9-469b-4368-931b-5200d6fd8e13","resolution":{"observed_at":"2026-08-06T14:36:17.735208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.802752Z","title":null,"venue":null,"work_id":"a85f726e-fff1-439e-9304-7f04c60007b9","year":2023},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.737673Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:32c7f62b54000a017bac1b663c1d59caf9d989f7ad01234a279ca40136fec6f9","observation_id":"15f36700-c942-4730-940c-ab614da42fed","resolution":{"observed_at":"2026-08-06T14:36:17.806252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.740027Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.740027Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:dbec2f7da86f10492b36f3ad8826bfc874e67365f5911b064c2e0b34b3b7a828","observation_id":"8adcdb16-d28a-47a2-8e91-34efca6867d6","resolution":{"observed_at":"2026-08-06T14:36:17.740027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-08-14T14:35:02.110612Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-08-06T14:36:17.742562Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.742562Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:03ef9ae82566eb99d1a08ede61e35e0a5c35be19f806ef3f057343e475228b8b","observation_id":"d994a22b-3a6b-4c21-b371-85d8f4a306b1","resolution":{"observed_at":"2026-08-06T14:36:17.742562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.901115Z","title":"InIEEE International Conference on Computer Vision","venue":null,"work_id":"d9055cd6-2cc7-46b3-aa8f-6e9a17cd0dbb","year":null},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.686968Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:2411aa7356205e289a4bfd2ccf80da30d6ab4c96f5154f86bfb4a7f7e0ff3277","observation_id":"5253b98f-802d-41e5-869e-c8d0dc454592","resolution":{"observed_at":"2026-08-06T14:36:17.904087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:17.876717Z","title":"In IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"23cfd1e9-0fe3-489a-8312-bb74c7ff949e","year":null},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.695722Z"},"links":{"citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:d486d9280be5d65ef4a4fc12752d14538b2ae62543c54645ba3099c19f39a635","observation_id":"feba9fdd-08f2-42e7-ab01-93652b152ea4","resolution":{"observed_at":"2026-08-06T14:36:17.880291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T12:43:57.033621Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2507.18552."}