{"as_of":"2026-08-07T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9d3ead4d727fef308ffa296745b4f004aa3da3b6c5f30866c0703367395acd7","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:36:29.862040Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T04:35:39.356919Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T04:39:35.268570Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"cited_work":{"arxiv_id":"2507.18531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18531","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intentvcnet: Bridging spatio-temporal gaps for intention- oriented controllable video captioning","venue":null,"work_id":"4c20facf-00b3-4eb2-8244-05275c135f39","year":2025},"citing_paper":{"arxiv_id":"2605.21411","last_updated":"2026-05-20T17:08:18Z","snapshot_observed_at":"2026-08-01T18:43:45.428590Z","submitted_at":"2026-05-20T17:08:18Z","title":"RoadTones: Tone Controllable Text Generation from Road Event Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T04:35:39.356919Z"},"links":{"cited_paper":"/paper/2507.18531","citing_paper":"/paper/2605.21411"},"observation_digest":"sha256:16f111445372bb45d7bc3b64f6747880d4bbb78130e455b55e82311d8a5ac741","observation_id":"dc631b3f-aa4e-4c98-9e70-26fcb13e0df4","resolution":{"observed_at":"2026-05-21T04:39:35.270214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.18531/citation-record","integrity":"/paper/2507.18531/integrity","json":"/paper/2507.18531/citation-record.json","paper":"/paper/2507.18531"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T14:36:28.756643Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.756643Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:28927fbd612f49388a4c41ffa1167491f7553f6d77ea3ce66d0fe91055cbb594","observation_id":"dc6a7e31-8201-4180-ba38-9dafbbc109b2","resolution":{"observed_at":"2026-08-06T14:36:28.756643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:28.774002Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.774002Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:0715767c99428f41f4c2144afc7107a858f15024b1aeb4340eabba1a4868b53c","observation_id":"42204628-102c-42c1-b5f6-45ebfafbd812","resolution":{"observed_at":"2026-08-06T14:36:28.774002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.625974Z","title":null,"venue":null,"work_id":"e96b422b-19cf-494a-b326-d52f8139f0a5","year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.804732Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:9e7790849ab67046e8cc0925d470439a9a99e713e62a40783ac97d246f414494","observation_id":"2f414133-f829-442a-b0ed-51acb9ff197f","resolution":{"observed_at":"2026-08-06T14:36:33.630954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-07-06T15:30:49.735343Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-06T14:36:28.824818Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.824818Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:cd32df0c36e11df163fbf68f49605c5e86c3231ae89058505c169402b6b438ad","observation_id":"bbb85bc4-a452-4b8e-8689-a4428efd383a","resolution":{"observed_at":"2026-08-06T14:36:28.824818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:28.830571Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.830571Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:ab25de27d6e186865cf58c8f60a72ef600a83bffac3f0d8ad633310d0193693f","observation_id":"13215b2a-2602-4f18-bf25-eeb3a07d5c9b","resolution":{"observed_at":"2026-08-06T14:36:28.830571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.592959Z","title":null,"venue":null,"work_id":"f1664d64-d03a-4223-9b10-a3d8b110ec0d","year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.862647Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:2c418e765f0ee31b086e08ac00408e511fa59e4ecd6a2ac1923c401173214c95","observation_id":"731f6ea5-715e-42e1-b475-8aae446a1e72","resolution":{"observed_at":"2026-08-06T14:36:33.598539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.554738Z","title":null,"venue":null,"work_id":"a4982b51-ca74-4342-b825-d821e0c9ab05","year":2017},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.870648Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:d545ffdc9191bf912940dd85399e255770484cbf41048071bcc5e5556d5f129a","observation_id":"a16528c4-38d0-4fba-ac9f-3c2da59e467c","resolution":{"observed_at":"2026-08-06T14:36:33.567933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T14:36:28.875907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.875907Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:e3d58df972329c66236c4c4f0a58cbf70f3622c762b15acf086353c00db0b049","observation_id":"0c156231-190f-4f73-82ca-c18507dc9569","resolution":{"observed_at":"2026-08-06T14:36:28.875907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.512690Z","title":null,"venue":null,"work_id":"f4f9b571-5e77-4881-bad2-865277c18ce4","year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.884001Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:d11e4f71391cef710954a4fb3d1dc0b788021a28bec0706f15c167659cd6f898","observation_id":"4ad8fe91-e6ad-465f-808c-5951059f9066","resolution":{"observed_at":"2026-08-06T14:36:33.519400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T14:36:28.890640Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.890640Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:91ad5c86d132e2693b0105fc7a0347bbed3a273df8c85611f22981004121f3d5","observation_id":"76d80ee7-7cae-45e7-a7ff-4b17429fda7c","resolution":{"observed_at":"2026-08-06T14:36:28.890640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.478396Z","title":null,"venue":null,"work_id":"1e0d0098-4f92-4a6c-9be3-fea6cab7e97e","year":2019},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.896730Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:e1f033b9766d397bca080b03b28df9b65aede3a80e3e9d5ae9d42ee4a599eec1","observation_id":"0523fc10-059e-42a5-8757-946baf492dc1","resolution":{"observed_at":"2026-08-06T14:36:33.484662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:28.902907Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.902907Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:25b63b7ab7a606c6e370b378efea5cb0f42dea3b5e7e75682b958c10e73030ba","observation_id":"5abe577e-90ef-4cc7-bd88-a015cf6a7550","resolution":{"observed_at":"2026-08-06T14:36:28.902907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:28.911252Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.911252Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:d2861f58aad0a027e7def37f3abfb64780f34c3a5d082a07c96024b85c9b3c46","observation_id":"308f1e94-137a-42e2-afa2-859c0e6185df","resolution":{"observed_at":"2026-08-06T14:36:28.911252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.399009Z","title":"Kastner, Yasutomo Kawanishi, Trung Thanh Nguyen, and Junan Chen","venue":null,"work_id":"79a65014-de57-4130-a2e9-379e8cdbe644","year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.918071Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:bb794ba99fe5ca883eda04ae9cf08724c99953fc747538df8e6632e17ec19374","observation_id":"30c5393b-afda-49a0-8f06-22ab38060af6","resolution":{"observed_at":"2026-08-06T14:36:33.409054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:28.935806Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.935806Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:e1a78be53833aaed625b447e038d93106676cab31239e9473c6f0d8f6b5a6d64","observation_id":"b4dad6c9-5a3b-4527-bb40-5c391699ec5b","resolution":{"observed_at":"2026-08-06T14:36:28.935806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.242255Z","title":null,"venue":null,"work_id":"9e283232-8530-47d7-a3b5-1f649c7212ac","year":2017},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.950400Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:f6324f4780d0a7d4e71a0c3a270686b48f6dbfdaa27fd80b9b782245d26d6f3c","observation_id":"dfe291c8-0c5b-44b1-a2eb-1298ca80235e","resolution":{"observed_at":"2026-08-06T14:36:33.330172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.043988Z","title":null,"venue":null,"work_id":"7c9b86a4-3a3f-4802-af1f-838bbe129aa8","year":2021},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.957212Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:48683bd2e3a1db8dcfdb90bc097249111d52fee972d5f35d38712f6b348d017a","observation_id":"93078549-2e74-4600-8872-1a6b7649fb2a","resolution":{"observed_at":"2026-08-06T14:36:33.136958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18385","last_updated":"2024-02-28T15:05:43Z","snapshot_observed_at":"2026-07-06T17:36:52.920342Z","submitted_at":"2024-02-28T15:05:43Z","title":"The First Place Solution of WSDM Cup 2024: Leveraging Large Language Models for Conversational Multi-Doc QA","version":1},"cited_work":{"arxiv_id":"2402.18385","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.18385","snapshot_observed_at":"2026-08-06T14:36:30.671870Z","title":"The First Place Solution of WSDM Cup 2024: Leveraging Large Language Models for Conversational Multi-Doc QA","venue":"cs.CL","work_id":"1db82f90-6477-464b-8081-01e713b5b3cc","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.963157Z"},"links":{"cited_paper":"/paper/2402.18385","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:11f4057c7d95382a69e25829d7cab1d704c99bb77cc172e9e647a0352d4aaae6","observation_id":"288323a4-0bae-499f-a36d-8327cb51eeba","resolution":{"observed_at":"2026-08-06T14:36:30.683604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06071","last_updated":"2024-03-05T14:36:12Z","snapshot_observed_at":"2026-07-30T19:32:30.807724Z","submitted_at":"2024-01-11T17:41:57Z","title":"GroundingGPT:Language Enhanced Multi-modal Grounding Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06071","snapshot_observed_at":"2026-08-06T14:36:28.980544Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.980544Z"},"links":{"cited_paper":"/paper/2401.06071","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:01bf113d2b244cd4e62735931346f6b73ab4550ae7649fe194b9a35c485f2573","observation_id":"6149dfaf-44e7-4ebe-91ac-a649344baf6b","resolution":{"observed_at":"2026-08-06T14:36:28.980544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T14:36:28.987835Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.987835Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:43e8f6f84705edb36db72520c4523dea70387c682f28a2a6acd2cf0085e89e1e","observation_id":"6e131865-637e-4ff8-b0d5-85303bf7a887","resolution":{"observed_at":"2026-08-06T14:36:28.987835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:32.859609Z","title":null,"venue":null,"work_id":"823580b6-86e8-432b-b7c1-8c52f0f9ac6f","year":2022},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.038967Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:41864f058e6d5dde383a13975996a34e0bbf1e97d56b6213a71aa3c9aa0ba4f9","observation_id":"8577305e-dd05-4d2f-afa0-f5367d9c21b6","resolution":{"observed_at":"2026-08-06T14:36:32.907929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.074740Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.074740Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:59ffcfab2ac495247f137d450d537627fa995909f58894e217644dbd01803afb","observation_id":"0bd1384c-21e0-418e-a515-4dca5363be3d","resolution":{"observed_at":"2026-08-06T14:36:29.074740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-06T14:36:29.101479Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.101479Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:bd56db2a8cfb5059fcf1edf81c1c5d0a46ff8e084dc372989940e4765390e2b6","observation_id":"9a5d55e2-8499-4997-8b8f-7e832017e2e5","resolution":{"observed_at":"2026-08-06T14:36:29.101479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.124744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.124744Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:02d2149bd6e19b646e9dbbdc2745a36cde317365c321491ba2ca5d78cd5f0ebb","observation_id":"cfb91417-6894-4509-bd7d-a56b5435c770","resolution":{"observed_at":"2026-08-06T14:36:29.124744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.149139Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.149139Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:8b2ae8d3f425de50b598ef4a8cbdfef677d749687a620ae004e607ac8ddcd124","observation_id":"ae3ba893-d498-469e-b526-bc5454769ffc","resolution":{"observed_at":"2026-08-06T14:36:29.149139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02300","last_updated":"2017-08-07T20:50:24Z","snapshot_observed_at":"2026-08-02T01:44:42.585261Z","submitted_at":"2017-08-07T20:50:24Z","title":"Reinforced Video Captioning with Entailment Rewards","version":1},"cited_work":{"arxiv_id":"1708.02300","doi":null,"metadata_source":"pith","pith_arxiv_id":"1708.02300","snapshot_observed_at":"2026-08-06T14:36:30.533636Z","title":"Reinforced Video Captioning with Entailment Rewards","venue":"cs.CL","work_id":"a2c5247b-9ab5-48e4-894b-926e2416b5ac","year":2017},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.160509Z"},"links":{"cited_paper":"/paper/1708.02300","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:c4cba3fe6e2c9f07d482da7a5714e8f615a49214a5b8a8652c70ded1f153a3c3","observation_id":"5e52972a-9ce2-4cb0-94fb-a9ebb190d69b","resolution":{"observed_at":"2026-08-06T14:36:30.540454Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T14:36:29.179246Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.179246Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:66de7139467240a4dcc0d7e72fa4ab449616bf96d93d1c7d6971f8c5b1b45b93","observation_id":"bac88a13-b8bd-4d48-a736-82ca1ff6b729","resolution":{"observed_at":"2026-08-06T14:36:29.179246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:32.583886Z","title":null,"venue":null,"work_id":"ad0ef2b7-2087-43b9-af05-684149ab40d2","year":2004},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.204885Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:958a932a256e15d4af6878be8202aa37b79b3c1cb997af583a791dbd625fa23e","observation_id":"0481b339-1842-4dcd-a94c-bd18a6cd7b7a","resolution":{"observed_at":"2026-08-06T14:36:32.645965Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-06T14:36:29.216841Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.216841Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:49996e42f3aa51a9fe9a13efb298ae3576984b87eff283aba41feac3fa09ff70","observation_id":"bc1ed0eb-b562-42ae-a323-31a5a96752f1","resolution":{"observed_at":"2026-08-06T14:36:29.216841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.236144Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.236144Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:1fd911cb006872e18e344c0f6ec54e1634900913b451bc75ccd555951d89d1b1","observation_id":"f0a0e0de-24b5-4f19-a70d-d297d9ff9c47","resolution":{"observed_at":"2026-08-06T14:36:29.236144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.279165Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.279165Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:197adc3d14f4f342309424ca34b12ff78e35a6f93b43be1789e7719704d07327","observation_id":"4374199a-da92-4eb0-95ac-ec8cef97716d","resolution":{"observed_at":"2026-08-06T14:36:29.279165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.296001Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.296001Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:849699fbea75304f546bc1e1d63f32450a9bc441c89b5fc64a817d409ece8dd5","observation_id":"3dc758d5-3d19-4cd6-847a-be6cc3d62e1e","resolution":{"observed_at":"2026-08-06T14:36:29.296001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.332967Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.332967Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:3c87fb869eada0dff762823a8f24b397ca1281512adbefe2b64561ec9a164fe5","observation_id":"07d0839b-d37b-44fd-9e28-5f60c3c7f7dd","resolution":{"observed_at":"2026-08-06T14:36:29.332967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.326969Z","title":"In Proceedings of the 31st ACM International Conference on Multimedia","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.326969Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:842eefd32da564f65b3b047349796c0cf2e289195c2e137475c2c9e573fe0beb","observation_id":"06e59a2a-f5cb-47b1-8749-73b6fb7f2721","resolution":{"observed_at":"2026-08-06T14:36:29.326969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05541","last_updated":"2025-04-09T02:30:44Z","snapshot_observed_at":"2026-07-06T21:05:49.342867Z","submitted_at":"2025-04-07T22:35:36Z","title":"Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05541","snapshot_observed_at":"2026-08-06T14:36:29.394779Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.394779Z"},"links":{"cited_paper":"/paper/2504.05541","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:0a3e21d5ca8f79fc47c16eba407fe3659d18811c0fcafe4d075b81e71f4c93b4","observation_id":"ad3ad4e7-b1ae-4c7d-b6bc-9f6e5a73b46a","resolution":{"observed_at":"2026-08-06T14:36:29.394779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.447467Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.447467Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:82e608d66bebf271551fead34e44d6cac7e78473310fdaa2c4459254131ec5d2","observation_id":"095751ea-1c5c-419e-8643-040b6bf1c3d9","resolution":{"observed_at":"2026-08-06T14:36:29.447467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.917024Z","title":null,"venue":null,"work_id":"9361b717-fbd7-4e33-929a-3e9915180c6c","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.365989Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:18b88712c33c95aa5758308a3b0cd1d90d41b391db8736129791f89da651c301","observation_id":"319a4095-870c-416d-a64c-ca4636aa7a69","resolution":{"observed_at":"2026-08-06T14:36:32.040258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.624489Z","title":null,"venue":null,"work_id":"6d44ee86-25e3-40e3-8ce6-9e26fbf886e3","year":2019},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.491095Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:db49fb7cf8168ada7907bdc8d530edb310b944837c4c6048b30e68e9baeb239e","observation_id":"31188037-4dab-4cc2-ad2d-635ee4f64788","resolution":{"observed_at":"2026-08-06T14:36:31.694759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.524741Z","title":null,"venue":null,"work_id":"f313113c-5bec-4693-881c-c63ac0f565ee","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.499869Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:f2a37cb7a642b4c0bf0eaed57a45882cf050af8d3bf455c2781168a30a74d636","observation_id":"f38be541-5772-4fe8-9f6b-4b15eb7bf32b","resolution":{"observed_at":"2026-08-06T14:36:31.549968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.474796Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.474796Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:1bda50e61839d3d7e8cdb725fbc7f1d6029d015f126b926f12c1f4b99a356453","observation_id":"19b5d2ad-b7c1-4368-8a6c-07d279cc7f99","resolution":{"observed_at":"2026-08-06T14:36:29.474796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.130137Z","title":null,"venue":null,"work_id":"800cd703-4319-4944-8645-74177b46e108","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.532008Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:26fd014229acbf8f0b24e4d1189b347d1cc1e254d6655d350c5e57746f48cd3c","observation_id":"c973e061-80aa-4b03-9b71-d641c42539c6","resolution":{"observed_at":"2026-08-06T14:36:31.138936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-06T14:36:29.583224Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.583224Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:1ed6d815f747aa8f073c459b752653d56d3bc108d0c5e42d295c8079c7212efc","observation_id":"9e461aa4-bd38-4e8b-a4bb-e5313aa4cb95","resolution":{"observed_at":"2026-08-06T14:36:29.583224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.427880Z","title":null,"venue":null,"work_id":"06b068ea-f0d4-43ee-9c42-38d352b5bac2","year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.509421Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:b30d64ce9912cc652ddac99bdfcbb3fac399641192e9427fc24d65489c7c6751","observation_id":"c9b73b3b-3978-44c9-8fe7-ea8da1860696","resolution":{"observed_at":"2026-08-06T14:36:31.450436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.023599Z","title":null,"venue":null,"work_id":"8965b1e2-c35f-4d58-a7a7-ffef06445de5","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.654739Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:e19faf94bf775064464833ede5d6d4509fd07619c6ddcea0cd862674bd9c73d9","observation_id":"c5cf68d7-08d0-45c3-9875-4330fd4e649a","resolution":{"observed_at":"2026-08-06T14:36:31.038003Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-07-06T18:50:13.559866Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-06T14:36:29.673490Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.673490Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:1a33dcccee04879fabed9a129c33cb2f0f17999a6b34ed8f792861d438d651b6","observation_id":"53ec807f-a90b-4c6d-a069-f22338da95a8","resolution":{"observed_at":"2026-08-06T14:36:29.673490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06430","last_updated":"2023-03-02T08:24:23Z","snapshot_observed_at":"2026-08-05T13:08:29.965661Z","submitted_at":"2022-09-14T05:47:02Z","title":"CLIP-ViP: Adapting Pre-trained Image-Text Model to Video-Language Representation Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06430","snapshot_observed_at":"2026-08-06T14:36:29.684895Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.684895Z"},"links":{"cited_paper":"/paper/2209.06430","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:d4adbe1201966051872a4df9699dc7aa9ec38243ba632843bf03da2c1a4d9426","observation_id":"68df01c5-db36-4869-a1ba-cc133ae62b8f","resolution":{"observed_at":"2026-08-06T14:36:29.684895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.098105Z","title":null,"venue":null,"work_id":"53482b7b-9b34-4d43-90aa-7cb2bfe2e70b","year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.607606Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:30fd4f379d5782913c6bd2b1166c4e774d51c2f8bfef31c98e656aa4d5f569dd","observation_id":"5835d953-a9c2-44f1-84de-92bb33d1d9e7","resolution":{"observed_at":"2026-08-06T14:36:31.110929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.709137Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.709137Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:0b4cc90deba6d4c9ebdc2035ece74a74af1f626d58552b2f790b1aa3d5213290","observation_id":"d7067fad-f68f-460a-a4fe-d845ebd89253","resolution":{"observed_at":"2026-08-06T14:36:29.709137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:30.971689Z","title":null,"venue":null,"work_id":"f8193561-7259-41f4-962c-37072df3503d","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.726957Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:3693910169edf067b38b39800be28e45d6bd3898ece2641e031c636909af5206","observation_id":"31dcf7d2-1e4f-48d5-88ad-189e61538283","resolution":{"observed_at":"2026-08-06T14:36:30.976741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:30.925480Z","title":null,"venue":null,"work_id":"0fa1e0e9-702f-4333-bc43-71bbb2d21d03","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.741989Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:46a0233578a70d5b14b0e7cccae93526f5767f5574c2be1ce57895eaff535b5d","observation_id":"29c554df-1207-4a9c-80f4-2f8247fbcc36","resolution":{"observed_at":"2026-08-06T14:36:30.946168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:30.900656Z","title":null,"venue":null,"work_id":"5ba2322f-9b5a-46ae-b505-cbf5cfa44505","year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.748938Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:25c870f4bf2324ef2e54ca49535faaf440899bef7f00843412cff5169b036061","observation_id":"03d931d2-76c4-40a9-b6b1-26f88676df9e","resolution":{"observed_at":"2026-08-06T14:36:30.906135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T14:36:29.695562Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.695562Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:79c052178a850711c415a2fb6e2c50bba54f114bb686b449bd9d0815d4af3555","observation_id":"a70c7932-59e7-4ac5-a0af-b4d76ac58e99","resolution":{"observed_at":"2026-08-06T14:36:29.695562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T14:36:29.767987Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.767987Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:82033b7afe6882fb59a74dd1ec74ad90bb2607a0a94e9e3335a70e5e2ca415e0","observation_id":"fcf9863a-fb78-41c6-92da-21c52c478f7c","resolution":{"observed_at":"2026-08-06T14:36:29.767987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-06T14:36:29.714217Z","title":"arXiv preprint arXiv:2310.11441 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.714217Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:19120d20e63aac55c2f069d67b1d12769b1568f20868c760a7cfccdd353cb9dc","observation_id":"be0ef333-e251-4713-8cf3-b698da8e4b71","resolution":{"observed_at":"2026-08-06T14:36:29.714217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.787485Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.787485Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:e8db5ad6c7c42e04bb286f5aac4a0ce7b71f306b91f2fea504781744a83b2c9c","observation_id":"918efbcc-c026-423b-8c60-ec56077fd46b","resolution":{"observed_at":"2026-08-06T14:36:29.787485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:30.820478Z","title":null,"venue":null,"work_id":"4d0f6c57-8050-4a67-91f6-09746cbaff6f","year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.797201Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:81ca18e1b0e11807782c0b722aebdfed13a8788a4b710d67eb43593b2ae245b5","observation_id":"5e30fd84-e35e-4b66-8987-d6987b31df39","resolution":{"observed_at":"2026-08-06T14:36:30.825970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T14:36:29.809595Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.809595Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:809eaf10822c39d50b2bc404782cf19c4e0b1907a2374bd83a3a5ffbc80808fc","observation_id":"87f6d969-dcfa-47c6-a344-a8830c003976","resolution":{"observed_at":"2026-08-06T14:36:29.809595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-06T14:36:29.762895Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.762895Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:a14c3d1a9cbc210b16602918bb72d5f25d26ca76004cc6e6c9fe3cd9337ec651","observation_id":"535d5528-c211-40a6-89a1-41072bdde2d6","resolution":{"observed_at":"2026-08-06T14:36:29.762895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T14:36:29.862040Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.862040Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:3cd461df8123616dd1e206b16cc136c5eccd31d0f8491a6c2a38f01c79f75c1c","observation_id":"97411bd4-bb74-4ae5-b95c-028126faebd9","resolution":{"observed_at":"2026-08-06T14:36:29.862040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:30.857955Z","title":null,"venue":null,"work_id":"e9073ec4-501d-4ebe-9a7b-91a0ae0dfa8f","year":2019},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.780390Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:dad94df8f6c5aedd3b5bbe31c537cc561c301b2cf9ff981be2234c4ef290d944","observation_id":"03c16232-4046-467a-8847-08fb25ec7307","resolution":{"observed_at":"2026-08-06T14:36:30.864740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.03715","last_updated":"2020-07-14T16:51:47Z","snapshot_observed_at":"2026-08-03T14:23:36.096360Z","submitted_at":"2020-03-08T04:34:58Z","title":"OVC-Net: Object-Oriented Video Captioning with Temporal Graph and Detail Enhancement","version":5},"cited_work":{"arxiv_id":"2003.03715","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.03715","snapshot_observed_at":"2026-08-06T14:36:30.015005Z","title":"OVC-Net: Object-Oriented Video Captioning with Temporal Graph and Detail Enhancement","venue":"cs.CV","work_id":"893ecbab-896a-4b7f-bb4d-0c6e533a5bf1","year":2020},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.835315Z"},"links":{"cited_paper":"/paper/2003.03715","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:bc9684acdf87207aacd74f84ed08e218c9a674fc7c2eeda5cf98c23c41282303","observation_id":"3d196621-58ea-4326-ad9c-5b540ec82e8b","resolution":{"observed_at":"2026-08-06T14:36:30.025967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.225826Z","title":"In Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"68328ce8-5527-46b6-b097-86736e26711c","year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.515564Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:27d9477455d3f727ab72db205f027668612492fc918cc1c55365fc71f0e5df5f","observation_id":"1c897235-9b2f-48d4-afe8-7c2a0937e9fc","resolution":{"observed_at":"2026-08-06T14:36:31.241487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:32.205915Z","title":"In Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"5a57a287-cca5-454e-bf4b-cc32cd83d4ea","year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.356331Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:9673000493cd8b25e58775e21f658f0b865d8fa4343ffedfaacdabd5c4a28a3b","observation_id":"9e3a30e2-4a94-4ba2-abf5-c0628384966f","resolution":{"observed_at":"2026-08-06T14:36:32.304827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.063804Z","title":"In 2020 IEEE International Conference on Multimedia and Expo (ICME)","venue":null,"work_id":"6e089f7a-9cb8-41f0-a20d-3fbf7996f446","year":2020},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.625877Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:f9d4999c8eee7a12eab6493423604549e75fd089f01926596a77926623486b57","observation_id":"4d657601-617a-4e66-80b6-9ff221e4d053","resolution":{"observed_at":"2026-08-06T14:36:31.068892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T14:36:28.852339Z","title":"arXiv preprint arXiv:2306.15195 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.852339Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:c6dbc91e6f15b30bb58360eea7759354489ae7284273ec4f88c0f3dd14e7542e","observation_id":"a3898842-383a-46dc-bcdc-848142eec563","resolution":{"observed_at":"2026-08-06T14:36:28.852339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T14:36:28.146389Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":3,"verified_fuzzy":4},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2507.18531."}