{"as_of":"2026-08-13T08:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1f7e572fe2ef84a74895160bd92d10dea8ccc3385578767a3eab65fa3f898ff","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:10:55.840477Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:05:30.265355Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T13:05:30.363755Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"cited_work":{"arxiv_id":"2411.17481","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17481","snapshot_observed_at":"2026-08-11T13:05:30.363755Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","venue":"cs.CV","work_id":"bd678cb5-fc91-46dc-b566-f1bb459dc724","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.265355Z"},"links":{"cited_paper":"/paper/2411.17481","citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:b750fb8e4a43f3d94876478efbcee7c3d92b2809fa16af62fe51d0c250c57f1d","observation_id":"d1da524e-6e8d-46e2-9bc4-167b63b1c201","resolution":{"observed_at":"2026-08-11T13:05:30.367482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17481/citation-record","integrity":"/paper/2411.17481/integrity","json":"/paper/2411.17481/citation-record.json","paper":"/paper/2411.17481"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.998704Z","title":"Real-world anomaly detection in surveillance videos,","venue":null,"work_id":"14905387-07c1-4315-9cf3-ebae2c605c09","year":2018},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.221759Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:4f08458721c1ca63d72ba9f87d1b666e5008bcbb4a5008325d2f647390febff4","observation_id":"eaef100c-87e0-457b-aabc-b97721150d6c","resolution":{"observed_at":"2026-08-12T12:10:58.007363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:55.228967Z","title":"Toward video anomaly retrieval from video anomaly detection: New benchmarks and model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.228967Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:52d87a1c1908c501bb32370711a875d7abc3998f653b19a7d474e620f6665c5e","observation_id":"31b5088c-94aa-4529-b8f3-823ee63a1137","resolution":{"observed_at":"2026-08-12T12:10:55.228967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.959238Z","title":"Robust multi-drone multi-target tracking to resolve target occlusion: A benchmark,","venue":null,"work_id":"97367604-943c-4eea-938c-ebead62dd1ff","year":2023},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.235740Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:f6b3b6fe9868390844a39c8b9c4e9877f74bfbdc16a682ec6eed2fed0383b920","observation_id":"9a11d131-dc00-4c02-96d6-908cedde8615","resolution":{"observed_at":"2026-08-12T12:10:57.966703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.937238Z","title":"Yolov3-mt: A yolov3 using multi-target tracking for vehicle visual detection,","venue":null,"work_id":"08693d84-b99f-4e2f-a276-c6a4813b6793","year":2022},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.243540Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:2e64189d7a8c78874a69d2668e8cab76494f7fabe0b3ed3ed34c447e5cb193d0","observation_id":"a628c639-8cd9-4491-afed-f84628e65182","resolution":{"observed_at":"2026-08-12T12:10:57.943705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.907014Z","title":"Deepmtt: A deep learning maneuvering target-tracking algorithm based on bidirectional lstm network,","venue":null,"work_id":"49a7397c-dd6b-4fce-b3b5-dcfc26f4d3dd","year":2020},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.249889Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:d55a01802e1ac08aec82b51708a96aa15edb133246ba5cd576c725441fffbacf","observation_id":"57d5fea4-af98-469e-9c5c-d4d857be7c1b","resolution":{"observed_at":"2026-08-12T12:10:57.914941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.885099Z","title":"Robust obstacle detection and recognition for driver assistance systems,","venue":null,"work_id":"f1b67292-48e9-4802-862b-957f130e5ec9","year":2020},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.256748Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:b5361a9d6543c655e83b768c4bcc05a4448cb37751d4c90fbac6529beccce070","observation_id":"97b607a8-b33d-4e23-9c8b-83c9aadb03a0","resolution":{"observed_at":"2026-08-12T12:10:57.892101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:55.271170Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.271170Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:e32323283211085181dcc9a6d3175530fb774ae467343fcb33ace7114e28781b","observation_id":"281b165e-5ea9-44c5-a970-973b0f57012b","resolution":{"observed_at":"2026-08-12T12:10:55.271170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.845837Z","title":"Pareto refocusing for drone-view object detection,","venue":null,"work_id":"8314802c-8af1-46eb-8632-688c03cff044","year":2023},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.280109Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:bcb30388294cd6d5436ac8e82facd1c60c56abdf1dff6bcf04c70b7a804b4e97","observation_id":"07177e39-30b7-4ea5-97de-cc8b83974c3b","resolution":{"observed_at":"2026-08-12T12:10:57.851391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.821929Z","title":"Sparse r-cnn: End-to-end object detection with learnable proposals,","venue":null,"work_id":"6d456df2-c0ab-4500-bcba-213597dee937","year":2021},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.287581Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:145d6d38dee02e76c24465dee1c33f71ef9580f6ab8cd113889ddbee1388ea27","observation_id":"5519f4f9-17fe-4909-a7ab-3c5b52b19743","resolution":{"observed_at":"2026-08-12T12:10:57.828732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.791625Z","title":"Recent advances for aerial object detection: A survey,","venue":null,"work_id":"7ce8a3fe-dbf2-4a08-bb81-8f873dbcb3cf","year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.296963Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:177ed23cc1e501894bd8b415010a9bb260e6ec24b297c636e3d1c35a625cefba","observation_id":"6ab04fce-432d-425c-ac7b-bd8720d7d5c0","resolution":{"observed_at":"2026-08-12T12:10:57.801878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.762013Z","title":"Cascade r-cnn: Delving into high quality object detection,","venue":null,"work_id":"4d051728-0014-4194-aa96-164644e278f5","year":2018},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.303386Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:c67ea551eb60627d12b8f034f0d5b837e2ba6a203b65043c6da2476c0146a052","observation_id":"cd412ab2-9ec9-43ff-9eff-a59525b374f7","resolution":{"observed_at":"2026-08-12T12:10:57.777387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:55.309511Z","title":"Crnet: Context-guided reasoning network for detecting hard objects,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.309511Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:fca6f6552917088aecc4710c03d7ebb5a95d4810ebfd9f3ffac9982707e4420a","observation_id":"af5b13b6-11b2-4950-a99b-9b5046a65f1c","resolution":{"observed_at":"2026-08-12T12:10:55.309511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.702202Z","title":"Triple adversarial learning and multi-view imaginative reasoning for unsupervised domain adaptation person re-identification,","venue":null,"work_id":"1a219396-fef0-4e2d-9d35-d5142fc1cfe1","year":2021},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.314739Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:e2fbf4c8c12fccebda27d8c5dfc644b27f14e15ae008e699f322a020d695c25c","observation_id":"bd28b2bf-9a4d-4d8e-ae3c-0d2a4ac5240c","resolution":{"observed_at":"2026-08-12T12:10:57.710758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.660081Z","title":"Logical relation inference and multiview information interaction for domain adaptation person re-identification,","venue":null,"work_id":"b0578f48-8406-4241-a418-c3751e008c43","year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.323145Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:6057e017c107261dcb3aab00b888dd53538431e24d728b4a7499a95fc12b0d1e","observation_id":"dce6daa2-8e7f-48ad-9612-fc98dd500735","resolution":{"observed_at":"2026-08-12T12:10:57.670988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.620102Z","title":"Attribute-aligned domain- invariant feature learning for unsupervised domain adaptation person re-identification,","venue":null,"work_id":"cd8d436b-ed0c-49d4-814b-045d50008d6e","year":2021},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.331492Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:c3c8b2d83e8d7efee8f3555acc824476aa8956d4582aab6aabb8107ff5fdc866","observation_id":"779b5200-cfa5-4edd-8ae3-7813fb51ac7f","resolution":{"observed_at":"2026-08-12T12:10:57.631604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.596473Z","title":"Intermediary-guided bidi- rectional spatial–temporal aggregation network for video-based visible- infrared person re-identification,","venue":null,"work_id":"752fb6fe-ff3d-40b1-b749-d2f0d92a0c67","year":2023},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.338102Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:762f828d6a5d288320097991b4944a88d6ca135d461c827464d160e74486d89b","observation_id":"b04977b5-f773-42a5-8338-e1f790888dc4","resolution":{"observed_at":"2026-08-12T12:10:57.605290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.570750Z","title":"Video moment retrieval from text queries via single frame annotation,","venue":null,"work_id":"5501dd5e-9bdc-422b-b7e6-a793a31ce9ce","year":2022},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.346074Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:46522c8197193c83ea9b28d8b3186c529481054eb04e965b94246dadbfa2db5a","observation_id":"0c2c96ac-253f-426f-ae2f-1b87d47fa8e0","resolution":{"observed_at":"2026-08-12T12:10:57.579605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.535174Z","title":"Text-based local- ization of moments in a video corpus,","venue":null,"work_id":"03f4a537-42ef-4277-8d08-906c40042ebe","year":2021},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.352979Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:aa04755c36870822abad174fdf6a41a5eb542b24f22f0fa4f2d4b648b8a7e8bd","observation_id":"a4be4d36-af3a-481d-806f-989a0ead684f","resolution":{"observed_at":"2026-08-12T12:10:57.544199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.494790Z","title":"Language-guided multi-granularity con- text aggregation for temporal sentence grounding,","venue":null,"work_id":"8f72fb3c-a0c7-478e-b0ab-168e7fb54973","year":2023},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.358800Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:df67d78db67657d7968bcec8c544550fe1a0573e7d56d64dad054c17c5bfb579","observation_id":"2cc6412e-6b34-4c3f-a1d0-ae662818f792","resolution":{"observed_at":"2026-08-12T12:10:57.506772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:55.366297Z","title":"Conditional video diffusion network for fine-grained temporal sentence grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.366297Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:b579ad5b08c6e49f2f11116514592c62d6d8fed7838613e3faa9bd8cee5d919b","observation_id":"b3eddd23-d222-4e7b-aee1-d7939a42857c","resolution":{"observed_at":"2026-08-12T12:10:55.366297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.428145Z","title":"Relational net- work via cascade crf for video language grounding,","venue":null,"work_id":"d175cff3-2594-4d0a-b7a8-04af9ee0c456","year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.372296Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:02d88ab001c18e99781af817b14827c6482483e7c45fcb9e32b452f0f0453287","observation_id":"fc8aa203-30da-4a29-bf3b-506ebaec2eed","resolution":{"observed_at":"2026-08-12T12:10:57.437863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.388187Z","title":"Self-supervised learn- ing for semi-supervised temporal language grounding,","venue":null,"work_id":"834aee23-9602-46d3-ba0c-9330c3d9af5b","year":2023},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.378760Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:6b3083ed7028902fc9a3e6289940a14febe2a17cea0c0fa64f97ef45d476e1d7","observation_id":"bdd5dff6-2807-4bb7-a096-54df137a0ef1","resolution":{"observed_at":"2026-08-12T12:10:57.398725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.354168Z","title":"Zero-shot video moment retrieval with angular reconstructive text embeddings,","venue":null,"work_id":"60580724-4ad5-4a68-b629-84e1865733a0","year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.385953Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:b8697bbc132114f7544d474e71efac0cb9105e46d837747c6349abcddac373b9","observation_id":"5c001614-7cea-4750-8334-0e068401a662","resolution":{"observed_at":"2026-08-12T12:10:57.364436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.315941Z","title":"Point-supervised video temporal grounding,","venue":null,"work_id":"601c2413-7f7f-4095-a667-33e7a161ee1f","year":2023},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.400824Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:c990864ba212a9df7a81c5f1479115bf7069195ab1191d7b94bb80f31dd02400","observation_id":"d09b598e-52ec-4bff-b2ef-afd9a5b3fc8e","resolution":{"observed_at":"2026-08-12T12:10:57.323678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.275876Z","title":"Siamese learning with joint alignment and regression for weakly-supervised video paragraph grounding,","venue":null,"work_id":"9f9cb04c-03a0-48c7-ac58-d381b5a7c076","year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.411581Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:bf98680b08b986d3d2632b6289ef5ad869a5003f4458df359c01b119858d9ce2","observation_id":"7064981e-30c1-49d0-9e7d-c41c51d9a195","resolution":{"observed_at":"2026-08-12T12:10:57.292698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.242463Z","title":"Dense events grounding in video,","venue":null,"work_id":"21780ae0-39ef-474c-b8ac-4ffc3d6551f0","year":2021},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.419522Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:49bbb2cc181b2f6c5e94a53d32f6af32925fdab2e7e8ad64d936c7799a3a30f1","observation_id":"7247a033-831e-4e9b-b14b-396f4413be51","resolution":{"observed_at":"2026-08-12T12:10:57.250727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.198895Z","title":"Semi- supervised video paragraph grounding with contrastive encoder,","venue":null,"work_id":"37c79438-20da-4072-9e1b-6caa66d99acb","year":2022},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.431154Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:1a15a4ebc3a3c83c8dca727a808354c173a3e638915a7508073a963d55ecb0e8","observation_id":"c41c9aff-f822-4165-9c5d-937bef32f82e","resolution":{"observed_at":"2026-08-12T12:10:57.206893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.165856Z","title":"Gtlr: Graph- based transformer with language reconstruction for video paragraph grounding,","venue":null,"work_id":"c4434217-5b56-42ed-a1ca-f8dcc4b26789","year":2022},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.438415Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:f367827ec8238572f08a680a09fe52729c732f51bcd42b225da17506b12feb24","observation_id":"cb1b510d-c071-465f-b95b-6ca56db34df8","resolution":{"observed_at":"2026-08-12T12:10:57.175640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.133005Z","title":"Hierarchical semantic correspondence networks for video paragraph grounding,","venue":null,"work_id":"d273222e-ca2d-41a1-9fcd-2beea0bff45d","year":2023},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.457277Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:70ff5fe065120c66f03d9d5beb5e50dfac552067f74c668114215227f7707918","observation_id":"f6fdc42e-b1d2-4a79-a7c7-dab6e355f824","resolution":{"observed_at":"2026-08-12T12:10:57.142075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.093615Z","title":"End-to-end dense video grounding via parallel regression,","venue":null,"work_id":"6052434b-33ea-43a6-832a-f778f000ce86","year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.464960Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:d48bcb731021acebf24bb87603b86dcda25fe27b9c467c047c00608faea0b08a","observation_id":"9ac7e611-5dee-4e25-9195-bbfebbbca399","resolution":{"observed_at":"2026-08-12T12:10:57.106191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.071678Z","title":"Joint searching and grounding: Multi-granularity video content retrieval,","venue":null,"work_id":"31935b23-9aca-4a0f-8b93-f099309682cf","year":2023},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.476850Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:bb836780bfd1c9a54ebd895a71656979d423676a07490c93a2004818d5b79477","observation_id":"89768308-5145-4519-96ce-3ebf6ee12be3","resolution":{"observed_at":"2026-08-12T12:10:57.078811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.040166Z","title":"Learning 2d temporal adjacent networks for moment localization with natural language,","venue":null,"work_id":"93913724-5ed2-4c93-8278-06a3ba97111f","year":2020},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.484261Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:8db563dc2137ba80df8a6a069920eed648db7df97a813898f91790970ef67308","observation_id":"bc09617b-9423-4a3f-b53d-6fb5c988e262","resolution":{"observed_at":"2026-08-12T12:10:57.048620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:57.009399Z","title":"Multi- stage aggregated transformer network for temporal language localization in videos,","venue":null,"work_id":"27c2c61c-663f-4103-ad70-d863fc342280","year":2021},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.491258Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:c529faf8e904fae6e98f54f409444a1df1e936de078c5ff1a84c9f6b32728c28","observation_id":"abb226eb-ea76-4a74-ba12-1e7d274201af","resolution":{"observed_at":"2026-08-12T12:10:57.022172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.975072Z","title":"Structured multi- level interaction network for video moment localization via language query,","venue":null,"work_id":"80dc2b40-1a33-4f2f-a356-86336e3010af","year":2021},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.498945Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:55e9eda12f5c84bba023efc6ad435da17a0a6b11fbed099bc6a2951aa5a570a7","observation_id":"0a93133b-306f-4e67-9be2-1fff525ae7b8","resolution":{"observed_at":"2026-08-12T12:10:56.984458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.944471Z","title":"Progressive localization networks for language-based moment localization,","venue":null,"work_id":"a306a8eb-5c4d-4c05-b7ba-b49d8c79d10d","year":2023},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.507588Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:0e90f25cbdc383bf5ec2b99666f8f106266c614144e15c919ec4967503c135aa","observation_id":"904aa02a-57d4-4d36-bf93-60cbc5b7f9a5","resolution":{"observed_at":"2026-08-12T12:10:56.951168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.911408Z","title":"Fast video moment retrieval,","venue":null,"work_id":"7004e78a-064d-4aba-8beb-986e769011e7","year":2021},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.517023Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:f02338a1feaadb36d63d14ff77f4763751747909d715c4039c310e0cf7e77532","observation_id":"bebd8400-6143-45a6-8978-3a0b5e6f5605","resolution":{"observed_at":"2026-08-12T12:10:56.921860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.882882Z","title":"Exploring optical-flow-guided motion and detection-based appearance for temporal sentence ground- ing,","venue":null,"work_id":"1d867552-1f29-44eb-8646-073d524587cc","year":2023},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.525638Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:161a785f4e730581686943de17a48b12a94baa437d2ee6c0a6504150ee3a3ccf","observation_id":"745964d0-3fc6-4b3b-840b-42e42513c073","resolution":{"observed_at":"2026-08-12T12:10:56.891511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.857831Z","title":"Temporally language grounding with multi-modal multi-prompt tuning,","venue":null,"work_id":"405a32c9-42e3-4676-8512-7fad2a70e2c9","year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.536530Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:3a12bcfe66cdf5e87b13cc6a0c084a4e21a38c667f59051d11008aede0c6e17b","observation_id":"356a9870-e136-4849-a88b-362eb7e7c3ab","resolution":{"observed_at":"2026-08-12T12:10:56.865854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.831693Z","title":"Dynamic pathway for query- aware feature learning in language-driven action localization,","venue":null,"work_id":"51332853-2f1d-40c2-b9b7-84b27e09ba67","year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.545395Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:e14a2a7f2f0569abdfb701eda1af55400c79327f84c9ec62301f99cdb282c443","observation_id":"16d2b28d-e2b6-454b-b3dc-7e87085f5141","resolution":{"observed_at":"2026-08-12T12:10:56.838800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.803848Z","title":"Hierarchical local-global transformer for temporal sentence grounding,","venue":null,"work_id":"5eea3c73-6a57-4078-84c6-5adc55fb6145","year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.555239Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:a039880bf39bd5f14173ca57583156ce2706a86160867aa9400a76397ddbc7f7","observation_id":"bb0952c2-5809-4ae2-8a6f-6a416a57f8c8","resolution":{"observed_at":"2026-08-12T12:10:56.812687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.770479Z","title":"Local-global video-text interactions for temporal grounding,","venue":null,"work_id":"5c8c076f-adc6-430e-bb11-dae1274725ed","year":2020},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.566276Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:eee6848150692c3694fa3bd0fa8a5b037ac0bebc03093d970461588e04a7a6c5","observation_id":"a165414e-3311-494c-836c-e90376b8027d","resolution":{"observed_at":"2026-08-12T12:10:56.778771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:55.574992Z","title":"Proposal-free video grounding with contextual pyramid network,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.574992Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:fc4d4ee8af2a7e8adcd0d9e7427ba6d65ebc8d357d6b53ce79b68fb8f708afbe","observation_id":"123cc7e8-24fb-45a8-b838-28eac729dba5","resolution":{"observed_at":"2026-08-12T12:10:55.574992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.703949Z","title":"Hisa: Hierarchically semantic associating for video temporal grounding,","venue":null,"work_id":"ba2f09b2-584d-45d1-9d1f-23e078ce5e4c","year":2022},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.585509Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:072c35c4ec6c00dc8f40b8689a275acc816cb50cc7187a947684a55876e4840a","observation_id":"476b4db2-3661-40a4-8445-ebb3ebdfdc58","resolution":{"observed_at":"2026-08-12T12:10:56.716128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.679110Z","title":"Siamese alignment network for weakly supervised video moment retrieval,","venue":null,"work_id":"264db7fb-8c3d-4bcb-844d-460410793681","year":2022},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.595640Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:7c471d1940866f1051705cb98bf7f6140af075ab9f36c73f826301d60592fca7","observation_id":"706cef73-37c1-4842-ad64-6123afa8ecb2","resolution":{"observed_at":"2026-08-12T12:10:56.685834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.643842Z","title":"Weakly supervised temporal adjacent network for language grounding,","venue":null,"work_id":"995e14f4-e9af-4fcd-a333-0349b525b120","year":2021},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.605247Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:0dbd714b1cb045defef6b38f59a81a33b5e9118825e89742d74e6ba9941139f0","observation_id":"ea85aae1-eafe-44a7-a239-8a9909f657b6","resolution":{"observed_at":"2026-08-12T12:10:56.655937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.599660Z","title":"Asynce: Disentangling false-positives for weakly-supervised video grounding,","venue":null,"work_id":"933be4a0-7615-464d-a76c-c55c034050f2","year":2021},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.614296Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:7ac174a45583b70ca65f7bc48b7bb4dd948cb3ceed47e27646158738d1f47f9e","observation_id":"d1b290f1-fb02-4584-a06f-def87b6b991b","resolution":{"observed_at":"2026-08-12T12:10:56.608089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.572572Z","title":"Weakly supervised video moment retrieval from text queries,","venue":null,"work_id":"9aa2e1d2-677b-40e1-80bd-d602d56411f4","year":2019},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.622490Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:9f50ac56b0bc691fe3c001ac85db65f4fa135702441e30e91c1c235571396604","observation_id":"9be2053a-4c16-4911-a060-554cbd107b99","resolution":{"observed_at":"2026-08-12T12:10:56.582232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.541023Z","title":"Dual masked modeling for weakly-supervised temporal boundary discovery,","venue":null,"work_id":"c8e840a4-2874-4fc0-95c1-04ea8ecae712","year":2024},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.631708Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:c838168b00cee1bf37014055a8f36abec6fae48d5fb40412abe913a22d3c13e5","observation_id":"6b0e0ca3-3ec3-4576-beba-0d8cbbbba40d","resolution":{"observed_at":"2026-08-12T12:10:56.551350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.505479Z","title":"Weakly-supervised video moment retrieval via semantic completion network,","venue":null,"work_id":"1ea37bc4-bb0e-4c5b-a22a-ae96f2c77b05","year":2020},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.640237Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:4925e1894399f238fe1feab7da175eca2ea50f4faa9b144732b648f5569c79d5","observation_id":"bc9b5daa-58a0-4065-ac69-ee5e379c77ba","resolution":{"observed_at":"2026-08-12T12:10:56.518228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.475830Z","title":"Counterfactual cross-modality reasoning for weakly supervised video moment localization,","venue":null,"work_id":"3ff9243d-1010-4539-89a0-8ef32de83dd0","year":2023},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.647441Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:e9260f648fe883d0cd278ffe102ccf62c90b6783446f5c53a21112a2a6f1410f","observation_id":"f60be869-bce3-4bad-9699-25d68017782f","resolution":{"observed_at":"2026-08-12T12:10:56.486172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.448846Z","title":"Weakly supervised video moment localization with contrastive negative sample mining,","venue":null,"work_id":"f13999c3-f100-46ee-8b53-8184175fc070","year":2022},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.658452Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:3d5b6365f9d956d4594f0c71b205c05d1eeae92eebe9b9e1976f78477311b083","observation_id":"3718b914-5303-4331-8f6c-e4a85f011a21","resolution":{"observed_at":"2026-08-12T12:10:56.457021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.409561Z","title":"Weakly supervised temporal sentence grounding with gaussian-based contrastive proposal learning,","venue":null,"work_id":"e0d94835-e43b-4e6b-b767-d5fea37bc37f","year":2022},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.666437Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:bfebc6790fe4f339984da86633b720e57bf064d7f760a0fe3cfaf11d3e4d2988","observation_id":"591fc544-e965-4f76-b758-056159e74d75","resolution":{"observed_at":"2026-08-12T12:10:56.421029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:55.683885Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.683885Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:a72c3dc7a6709747df7b0a3918f504a090b3ac649f93b27a5bb6d69f90e8b656","observation_id":"fc880122-f95f-43bc-98bc-cbd2ab15241c","resolution":{"observed_at":"2026-08-12T12:10:55.683885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:55.693948Z","title":"Distributed representations of words and phrases and their composi- tionality,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.693948Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:5bd1cdcc7a844aa6515f982c14def1b0b7bc1749bd8292b4f3db0e561d85b725","observation_id":"dbbae8f7-b2b0-4e8c-8038-50c52347d6a0","resolution":{"observed_at":"2026-08-12T12:10:55.693948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.331350Z","title":"Learning spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":"9c279185-61bd-4fce-be04-dd3a47510b13","year":2015},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.703166Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:db8cdd534e12368b60728a44d8eeff470a6e420a7f81ab94c37cf84699b51b73","observation_id":"e41c29e5-d910-4ac9-9293-1e0aade0d9a2","resolution":{"observed_at":"2026-08-12T12:10:56.344172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:55.713164Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.713164Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:7be2dce721a970a8935f4f6d156d94048d62b96458e2f8094a7ee39381630837","observation_id":"ace8eb38-e77b-41f8-9fed-81bc565faba9","resolution":{"observed_at":"2026-08-12T12:10:55.713164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.263744Z","title":"Momentum contrast for unsupervised visual representation learning,","venue":null,"work_id":"8fd75810-bb77-4645-90db-a3cd9b306892","year":2020},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.721313Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:810ce4280c219516d81de7d8b6026162b6dd1c0dc9ed61345c76471e21da9b30","observation_id":"692669ed-90f7-448b-99b1-334e94fbe8b6","resolution":{"observed_at":"2026-08-12T12:10:56.274265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.229801Z","title":"Facenet: A unified embed- ding for face recognition and clustering,","venue":null,"work_id":"ac17fa76-7c7c-42b8-9312-821ae55ef270","year":2015},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.735438Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:41c163f94c5c832d6b8d934d601656f8612aa00eb731c7fe4f9aedd4b991a8bb","observation_id":"73ed2ad6-51cb-4c4a-8ed1-fc9933cb884a","resolution":{"observed_at":"2026-08-12T12:10:56.241021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.193957Z","title":"Localizing moments in video with natural language,","venue":null,"work_id":"3484fbbd-aa33-4b54-ae32-494a2e7fe77a","year":2017},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.743758Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:4747b1885c8e5aa9c5ea96b74520b383078115bea21857869cf9f9383f2a9128","observation_id":"86b12f83-b44e-4315-b23d-630af41182fd","resolution":{"observed_at":"2026-08-12T12:10:56.202818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12763","last_updated":"2022-02-23T12:44:54Z","snapshot_observed_at":"2026-08-06T16:08:12.712612Z","submitted_at":"2019-07-30T07:31:02Z","title":"Finding Moments in Video Collections Using Natural Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.12763","snapshot_observed_at":"2026-08-12T12:10:55.756529Z","title":"Temporal localization of moments in video collections with natural language,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.756529Z"},"links":{"cited_paper":"/paper/1907.12763","citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:8876bcf44e915565bbfc6412ba183d4b7ae4f02b49125353423c3ec60a97459c","observation_id":"c592310c-193f-4412-89ab-23c5c461d6fb","resolution":{"observed_at":"2026-08-12T12:10:55.756529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.166823Z","title":"Tvr: A large-scale dataset for video-subtitle moment retrieval,","venue":null,"work_id":"bb6d0186-e481-4341-a2bb-ff05bf081dd7","year":2020},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.766406Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:c50c99169f5c518ea05abd93972d55a7502e71a5a55c363fec8732e221a23739","observation_id":"996b2390-bc7f-47ba-aaee-88c99d94f32c","resolution":{"observed_at":"2026-08-12T12:10:56.174848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.127861Z","title":"Video corpus moment retrieval with contrastive learning,","venue":null,"work_id":"1070afbd-267c-41a7-99c4-c8f4e940df00","year":2021},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.773562Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:f69aa7c82a57492a83523e6f0739a98dd8d817bedd0f3d0ff71e0671862c4cf6","observation_id":"6488d2b5-6c46-4b77-a672-f6012f4cb817","resolution":{"observed_at":"2026-08-12T12:10:56.138402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.100528Z","title":"Partially relevant video retrieval,","venue":null,"work_id":"d0032565-a3c8-424c-99d9-10d9ddd37260","year":2022},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.786660Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:3ed1ff944ef4d55ab40ef95c7e685d35333c07a4f5e872bd43b193db789b8394","observation_id":"74012127-5934-42c2-b6d8-75edba98cb61","resolution":{"observed_at":"2026-08-12T12:10:56.110868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.066961Z","title":"Activitynet: A large-scale video benchmark for human activity un- derstanding,","venue":null,"work_id":"0c15fbd0-d940-4c5c-96a7-4d74440ecd8c","year":2015},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.798712Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:ddec9af60d7b337bfa5051015b71555af17a7ff06d7a560aa78bedc8a004a868","observation_id":"fb91f54b-b6a5-46d9-ac4a-ae7b47a43678","resolution":{"observed_at":"2026-08-12T12:10:56.076158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.029042Z","title":"Script data for attribute-based recognition of composite activities,","venue":null,"work_id":"751d3e2c-b71f-48a8-bfe2-2002bb6752df","year":2012},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.806435Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:494a425047323660902c41a8f7fac00157f4cd7f17e4a351f264916955fc9fad","observation_id":"94c8de35-35df-4911-8e86-750f68708180","resolution":{"observed_at":"2026-08-12T12:10:56.042480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:56.002328Z","title":"Grounding action descriptions in videos,","venue":null,"work_id":"794b1684-7dfd-4bc3-9e78-45d821a4e10b","year":2013},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.814847Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:b6f07f7141e4c59142705925f7dfa75cf5c6ddbdf49819cafcdafa88562c6896","observation_id":"43826049-c9dc-4d0b-9352-9585362fb38a","resolution":{"observed_at":"2026-08-12T12:10:56.013294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:55.979308Z","title":"Large-scale video classification with convolutional neural networks,","venue":null,"work_id":"3f0f09b7-c5ce-423b-81b2-f4829119bfb4","year":2014},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.825767Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:49005844435e90fa7a444d104cdd2183492e2670788356416482da4123de08ad","observation_id":"a12d2a91-9063-4d06-94b2-c424a82c6d4c","resolution":{"observed_at":"2026-08-12T12:10:55.987026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:10:55.951294Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"e9b186ca-7210-403f-b2a1-b55a926ca117","year":2019},"citing_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:55.840477Z"},"links":{"citing_paper":"/paper/2411.17481"},"observation_digest":"sha256:182999791a4f3420363491c366b1ffcd40fd8ac8e4cbdd904cc584c4b2281beb","observation_id":"a860967b-f719-4690-8a49-2f9b64fbb613","resolution":{"observed_at":"2026-08-12T12:10:55.959660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:46:15.104050Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":59},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2411.17481."}