{"as_of":"2026-08-04T06:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e83a9d649d85fda09c6bce9e78709d1df36a38d498b8d754738e4378a0930715","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T08:55:44.783824Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05093/citation-record","integrity":"/paper/2607.05093/integrity","json":"/paper/2607.05093/citation-record.json","paper":"/paper/2607.05093"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ACM Transactions on Multimedia Computing, Communications and Applications , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:df51a04ee3c27f789af854bab50e0807d2a99c678e0de81af9ccf2bb2e9d9bc0","observation_id":"55262a54-f80c-4cff-92b2-14c0fec26179","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:aaa20683ecc3f7516352e46c0ce90053e3ecba7ba836d6272b408195c325cfc5","observation_id":"c8d418f3-6752-46c7-8ae8-f0969011d5b5","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the IEEE international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:edb9bd88f21a801ead4658bcbaffadeda90f7cfdd80d626cda01be534360e295","observation_id":"ada26862-5658-4995-b0d0-ecf698a7738d","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:113673ae90af6e9ca74e471bd7a9fb8e20b4bacb09c0040d3ff112270f18a3f4","observation_id":"ffbffa7d-ea60-4910-a349-13fc531743b9","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:df591a89832efe8e28fa0b17f7f8d04d0b347f79b20317983b3ea9d7c9a358ab","observation_id":"165f8595-123f-46e8-b75c-1c37ff7053ff","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06430","last_updated":"2023-03-02T08:24:23Z","snapshot_observed_at":"2026-07-06T13:52:02.617210Z","submitted_at":"2022-09-14T05:47:02Z","title":"CLIP-ViP: Adapting Pre-trained Image-Text Model to Video-Language Representation Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06430","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2209.06430 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2209.06430","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:8c4448b044bf7c5b3a81a760b7bcf3ea6584d881cc759356adc09a99575a0777","observation_id":"7c807420-93b1-4ad1-948b-697b97b30293","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"European conference on computer Vision , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:d9962fd0a5fd85ebe59a7e7e6e4a4dbb701ae62c1f14a0cea05b622591a6d744","observation_id":"7875f27c-6f41-488d-a471-16cc77ef9e37","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:ba93b27db6f372a093bae70f174a471184cb40c5e3f56b04bbd434eac801408c","observation_id":"d7f5fdc7-2c5b-43fc-a23a-ba3d4c18b77d","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the ieee conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:ce53073fe220310e8a82f32fd7d631217fc67adad92e13f78a20e0c98784954f","observation_id":"4eb5f004-bf2f-4f65-b466-1d5ebca6cda5","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the 30th ACM international conference on multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:675e040bce60f7ad435a8f231dde5d143313bd532e42aa0c9aef584ca76641cc","observation_id":"e55fcd4c-5dd9-4ee1-9667-cc62d2255c5a","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:8d06f9a73d2f1bfbd3304c85ccd5732150ac68f6cbfc5a5e46394bd3673c7db7","observation_id":"3c1facbf-c2ad-438f-aee5-5851fb60be84","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08039","last_updated":"2021-09-17T01:49:19Z","snapshot_observed_at":"2026-08-04T02:25:57.235363Z","submitted_at":"2021-09-16T15:01:46Z","title":"A Survey on Temporal Sentence Grounding in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08039","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2109.08039 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2109.08039","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:9ecb80546a76f207dd2ec6f41944f20def9e39d4e04dad05b5c391fe84afc5ef","observation_id":"bee1b990-566e-4202-9f8c-a5b07b24308b","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Neurocomputing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:a434e2cfeb15427ad8556d4ba7b293782e6746dbe0441d8c65a8b6ab58d4be71","observation_id":"48929385-b7e0-4b89-a2b1-5e7fc40d9af2","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"NeurIPS , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:e2427b6387b6d4e081f976a4df2012d2af4bb1f87bcd5ffe795d13976eb145df","observation_id":"04a1d550-2ee5-4ede-a652-80bedec0166d","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"EMNLP , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:f9f26c2841265f5f7cf0e501907a3980f2ba53c7c8349eb9493f42f3dd3c0c6a","observation_id":"1c2feb81-1fb9-46c8-ba15-ead92e588904","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"AAAI , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:ba51de6829aebdaa11b1f06447122426c9b303dc54f9bff7863358a60446155e","observation_id":"673e1a3d-4c2b-4bd8-8cc0-82f326f50d5d","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14055","last_updated":"2024-07-22T03:17:29Z","snapshot_observed_at":"2026-07-06T17:06:41.478216Z","submitted_at":"2023-12-21T17:28:09Z","title":"Multi-Sentence Grounding for Long-term Instructional Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14055","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2312.14055 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2312.14055","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:3fb0c37cf8002f7351e372985bc1b00359734b3b598372317439e1591035faf5","observation_id":"153ef4bc-b9cd-4441-9cc1-036f58b0a0c5","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ICCV , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:c61ec4aa78207df0274a291dda11b8d5baac6d18157d884fbff554b6af1086a1","observation_id":"d31ab957-bba7-4dcd-b750-fe33ef832e0e","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08722","last_updated":"2021-06-18T16:42:59Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:25:05Z","title":"New canonical analysis for higher order topologically massive gravity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08722","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2104.08722 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2104.08722","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:74ab5a399a82a8b71d1084955eb1031f3abac55282b08c2e77ca0ba4ee0eb558","observation_id":"c08eaabd-40f4-46eb-ad0c-82f68d6d2229","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12478","last_updated":"2021-04-26T11:22:20Z","snapshot_observed_at":"2026-07-06T11:03:36.064983Z","submitted_at":"2021-04-26T11:22:20Z","title":"A deep learning model for gastric diffuse-type adenocarcinoma classification in whole slide images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12478","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2104.12478 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2104.12478","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:f8da041f48c44f865e67e64071ba36c1120c8b2970410c24ab6a8168d0d922bd","observation_id":"c8b4d1e1-900a-48b4-82db-49431a283d65","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09703","last_updated":"2021-11-18T14:09:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:09:15Z","title":"Faithful tracial states on quotients of C*-algebras","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09703","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2111.09703 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2111.09703","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:0c026aa62225a17d5243704d3fd040de226f81baa4c25db09c61d242ee93520e","observation_id":"7deb71fe-67ce-4419-aee8-fb2917eeb084","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ECCV , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:b3a8099c62c286c79cab42c1eae3df5710ce0502c95a42d9d414baab67aafeab","observation_id":"ba4ea735-d875-44d6-bcb9-95b3defcd43c","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"CVPR , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:db9e5fc65fbc01b890741e734abf90c8cbb7593c08e261ff375031c1f23da338","observation_id":"a712e6f9-84eb-455c-977c-0557cab6dae7","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:99ede87272ebef6a693a13e2327f968375ced438a553d33f4c404a73ea7f88fa","observation_id":"c889dd47-cf4f-4f9d-98d9-5795c16548bd","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"NeurIPS , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:15c711694c39264be0421249d31bff26a3ba1b4dfb8e2b75f5457bd207bb403f","observation_id":"e638d4d3-d0f5-4128-8a04-8c10872fead9","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ACL , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:9cbe2e28b613a1629a73b21ba55d297f9c227500bc93708f92f5841dc3b1fb10","observation_id":"9b583515-2afb-41ed-85d0-813ffc1de78e","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:f1355f8424fc24dcbbc4c6ff5f1e2a4b48e4bf7af510c15ab9d1775a32fc5761","observation_id":"2a068291-aa61-497c-ac81-f81100888972","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:8cb0acdbf7284864587572c7b3b3de60f1a687d2f0fac7cec657a1955dc012a4","observation_id":"8e94a50c-6a6c-4fd0-85c5-09cab160747d","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ACM MM , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:626399d5c46341666ac8407ef8a90a5caf1ad21f59e2be4933c0a6b025d294f3","observation_id":"781343a7-2a5e-445d-86bd-aec0c9b619f0","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:51f028a4da909185543442e03845c50995f2266680b8e4533c5060c22252b0f1","observation_id":"df73c806-495e-438c-8a8e-f411498c7af7","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the IEEE International Conference on Computer Vision (ICCV) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:7fc0163ed25f85cc39c4ae72137c8818590586f82b9aa9801494a51d55320dfb","observation_id":"54c7a38c-8e62-4f0b-8221-69de94c8450e","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the IEEE International Conference on Computer Vision (ICCV) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:b43b518c7971921430809ea4a8ccd633873e057a019e6abdedfa98d5b068f036","observation_id":"832c1049-2706-4972-82de-51903541d9d2","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d18-1015","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:57:57.891125Z","title":"Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP) , year=","venue":null,"work_id":"da206218-e90d-487b-a165-12e076c98fe1","year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:f4e1c4070d93e664a36c857f4dc8b9934fc0968088142c26fe1eeb366ea053f9","observation_id":"6bbce552-50bf-48bd-bb60-69ab42f86394","resolution":{"observed_at":"2026-07-11T08:57:57.892790Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T21:19:02.552122+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T21:19:02.552122+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:0cc880767311ac659dcb4a2af12b0f7000f566456af44752c521b40e041f93f8","observation_id":"44e47812-43b4-463f-97e5-4959c3001f4f","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00200","last_updated":"2020-09-29T20:37:17Z","snapshot_observed_at":"2026-07-06T09:16:45.827004Z","submitted_at":"2020-05-01T03:49:26Z","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00200","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2005.00200 , year=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2005.00200","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:d229176c78e85197589a3c761cc8f18e4b127c798e849c1c7710d25a71051f51","observation_id":"490c03fc-1224-4d82-beb0-35458f2dc982","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:0dc7b40e4aab26e4c2e1fd6038f5571047dacbf5f490557258fb5c3fefd212e6","observation_id":"41c33b64-f92e-448b-9841-4d6683c643df","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:d99a6aaae31778cfdecde267b897e8cbc8fa89e2d948157fefcdad4a2d721c62","observation_id":"f12e9b7e-b820-43a5-857f-8055616e50ca","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"2020 International joint conference on neural networks (IJCNN) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:f4787ce80327508ede81e0444b2a81823e817549d935ff8b190cacc3718c2b75","observation_id":"26ca58c7-add6-4bdf-a1d4-e0e7a03ea7f9","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:2d4b57003d254074098799dc4ec9d0ce98584722cc405d01ccdc8f4dc7f869cc","observation_id":"121b3b72-fb2c-49fc-9c82-ca7d7984afd2","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00609","last_updated":"2021-12-27T03:37:20Z","snapshot_observed_at":"2026-07-06T11:14:53.651087Z","submitted_at":"2021-06-01T16:22:01Z","title":"Robust Mutual Learning for Semi-supervised Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.00609","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2106.00609 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2106.00609","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:d04768377eda20cd6e869987ed67aebfcffa92386bd2cc5ab3e0b9c6523eb343","observation_id":"ab19360f-34e6-488a-99b7-fcf019c6ada4","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06353","last_updated":"2020-09-15T13:27:13Z","snapshot_observed_at":"2026-07-06T08:57:29.493849Z","submitted_at":"2020-02-15T10:03:25Z","title":"UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06353","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2002.06353 , year=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2002.06353","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:052abc4aea2cf1a6127c816de99b34b231c2888dc93542f6a68a7f12f7edc18e","observation_id":"640446db-cc29-4b3e-9280-5cf9887796b0","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:5f23571fc89ce58756adfbaaf84cea13a931f649e1a21185e4cbb60912463207","observation_id":"55515550-a588-455d-bf94-f57ba1151313","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2104.08860 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:9f0d2a8944502921506788faa2401f6d2a5226e1d6dda7aad9c28c7d6912cc9b","observation_id":"eb3295a6-4ac8-4ff7-b996-ca452ecc1e35","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"AAAI , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:e7964f4f544df438bc43acb4e378da7dc4c9f2bf8cd13e16fbfdba8a9cbd1a99","observation_id":"87339240-d5bd-48d8-a46d-874e6a7af08d","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:41c265710ea759279ffb000cd40c0103480de9439489b31b8ffe26b50d074040","observation_id":"248b6e58-7929-4ee4-91a0-016793a2ff2e","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the 2018 ACM Multimedia Conference on Multimedia Conference , year=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:a8ec5fd3f646a7425ba69756eefacf99bf66e8775132323d9c9c79c2e31e8c15","observation_id":"1c362fdb-c621-4f69-b79e-f6fad2d8fb9e","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:cf78a23db0d0608b526dca426116282efc48ac044f3685781cd6fcd7764a2d54","observation_id":"9f60ff83-2a36-407b-9737-cc320c822706","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Transactions of the Association for Computational Linguistics , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:096f07fa700c88fa108bde1ce7ac32e146ee394b07778a90195b6d41a3ab2772","observation_id":"835c9042-067d-4284-9b7b-7bcf26901b25","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:197114b0f9cc03a8eac128ffad232e5dabf19f96d68aa45953ebf653fa29c399","observation_id":"df6e549c-0449-4d1d-a128-1ae55acf3f59","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:ebc370caa9052c67aa0f3ec7b1abd136e35a3774657338e97eb87380f872a107","observation_id":"c66dfcca-9174-4d5c-8e90-1d44b6eb4489","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:d64fa248f372d2ddeaf3e2ccb8b1e600ea78ee2e121ecd15e4d1b59715ac7cfd","observation_id":"a93c1389-7ca0-4bf9-b152-bb88407e1167","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ICLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:010689356789e5402d6fc1608ebe664d61e0f038b7e10ecdbf9db92b788d8033","observation_id":"5f415e37-ac08-42d5-8f46-9fae820d1aa6","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:31daab123d3e4b174c889d41d22a407c8a6ac44c0c0d3b60ac6492119d194397","observation_id":"902fd7f0-770c-4707-a20f-c66dacd5871a","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:d81fa34586129841b004d23dd95e546ea9d028ac9d9f7506f42be91c9f2b0a1d","observation_id":"ae32119b-3674-45ff-a351-8a4a004dade8","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"2023 , note=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:3f9a65ce7976a8129563f75f044d5dbb3bf993e2c3d1bf34a6a38133a3442762","observation_id":"f49de522-0eb5-46d5-82ba-1f7143b50169","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ICCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:7f3dcfc8d989bda3f0776a4521f68da1558332603090a31d9e2e9857ff1b0ac6","observation_id":"92c038d3-1add-4488-8561-fa7ca8138db3","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ICCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:3f1f86e5b05be6b9a7e5b2b467ed8379fa75a9ce6f4a58a917dbd10ce794dc16","observation_id":"2a6f864d-922c-4b6a-b35e-e79c972e966c","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:c104aca92b9b2e5babad95b626f862eca8c8249d08ba5078b32cba55926ded2a","observation_id":"511d5965-9693-4788-902b-8c4e406931c8","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ICCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:44d5c6186da9b9b7d6af160db5a1305e87298e21d196772f9d51db6e19bf593b","observation_id":"de6f90f0-c54b-4175-b7a5-6f4731ffa7c2","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ICML , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:15a029c6eb440d5b3890c11867ebe4de29fbfe169f3d57af9dca62787de7058d","observation_id":"d71fd52e-9b45-453e-96ca-0137cf0618af","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"ICCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:3d21105272646eb16b01ae980e918b4d60be36aac9c78a11e02c2350f3f13bfe","observation_id":"c0706ea0-5b85-4281-bd27-9bbd784b0dbd","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17040","last_updated":"2023-11-28T18:52:38Z","snapshot_observed_at":"2026-07-06T16:53:58.875152Z","submitted_at":"2023-11-28T18:52:38Z","title":"Rumors with Changing Credibility","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17040","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2311.17040 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2311.17040","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:c4531acb92e30e223bce0fdadedbd8f7512b7c3cccb5b3de13a26838a30a8ed0","observation_id":"68c662f0-ec21-4cc8-9112-7bb59525b19c","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:89bf1cf26a70a87e429a901a8f3f1a827bbed42fb77bba0a4b0052669f4b4b67","observation_id":"7b40c2cf-c87d-44de-ab16-b13cb94da62c","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:6ccf359bb28c4b0b04eef76da4e7da8e76522fbf19ebf6118c90239e17e673a5","observation_id":"88c59778-80a1-4b3f-a0fa-8613da300e3e","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:ab7daa530f52501ba16069c641435d2510a7217f6884e66cae1c6cf7e89dd1dc","observation_id":"118fc319-e580-4368-934b-53743c3cd9d4","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , number=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:c88e1ce163c603a14026d6010fffdafcf30a50eec6c9e505380b90d7211923fa","observation_id":"da24e050-6003-441e-b19c-1eb9c9c56822","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"International Conference on Computer Vision (ICCV) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:715b8253977457ee04454efcd9371dfe42ffa8c9beb9274ccfeae9c62a040da8","observation_id":"0ae81f5e-566d-461b-9d92-b60570d10339","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:151f5342640a21920000d021230496d6de35244e60175869500dfc989cd9b1aa","observation_id":"4fcc1e16-d361-4e99-ab70-a5e3d8574293","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:a000d8ed2dfa6ea529734e7f8c99c3ca1273c080768e3e66b74134b0eaf6ab2f","observation_id":"be989242-a4a8-442e-bbdc-86e26f3bb2c1","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:5469e45d111f2478a1d3ce544e2face027d358bfe581289e366c81df2bf69a61","observation_id":"4b773d14-221c-4d5a-a45b-b2bada4b0ed6","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05643","last_updated":"2025-03-03T10:28:30Z","snapshot_observed_at":"2026-08-01T19:33:10.793870Z","submitted_at":"2024-10-08T02:46:30Z","title":"TRACE: Temporal Grounding Video LLM via Causal Event Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05643","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2410.05643 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2410.05643","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:05997b452f5d619f49d9fc436f75bb06ae5533da3639ee7f81ae80083ead4d81","observation_id":"f2c9639d-15ba-4aa4-a322-ed7ed8509621","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the 32nd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:b95e114816787bf14ffdcadf08205bcc74ca9b6e73c5918da21b796f1761bf00","observation_id":"9daa2dc9-87e9-419d-8b09-f161ade8dac5","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP) , year =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:2abfb7f794cadd5f695fea9bde8822e882b26a62387fab2aaa8d5c7f46980917","observation_id":"6edbff85-44b3-4786-877b-e089c00563d6","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"European Conference on Computer Vision (ECCV) Workshops , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:f26fcf116c93aa95c49886bbcaeab1c7b802900c6ae06f768b07951e6b6a7c1c","observation_id":"c55fedda-816e-4b44-9941-7d6f81291dad","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the 2024 International Conference on Multimedia Retrieval (ICMR) , pages =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:0bcc05b3c604412dc14fc89cd103cc2f1f1483878e34fe62054828f9052d772b","observation_id":"0a6de2b3-d413-4038-953d-9c5aa60371de","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:a9c6128cf34bbef68b056e7c21b298464e8fc0d0722d5b0e6c01bfecd00f73c8","observation_id":"693dc66a-8da6-4120-a3f2-d797acdb51f5","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:b17424e07ab432002b521b0f3e173cb9104be57a6a6658d0ba37bd21ff4e0054","observation_id":"7e1755a8-9c03-4728-8ce0-99bd36c62bfc","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-11T08:55:41.637851Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2607.05093."}