{"as_of":"2026-08-07T07:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20ca436923a5f280aa14cb86b344e01c9c46b1a0dc6182c16e8ea12a00e5d275","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:01:57.130532Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12062/citation-record","integrity":"/paper/2507.12062/integrity","json":"/paper/2507.12062/citation-record.json","paper":"/paper/2507.12062"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:05.683402Z","title":null,"venue":null,"work_id":"3104f421-e27f-4114-8442-17063bd20be5","year":2017},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:50.869181Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:d32b6f456e4134dacf2eb47f852950a74ed6a732338f125b42dea522a1563544","observation_id":"da313600-2ef0-41ac-8b33-b19edd209f0e","resolution":{"observed_at":"2026-08-06T17:02:05.774182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:05.536668Z","title":null,"venue":null,"work_id":"a88507fe-42c9-4d25-ab31-d736dd58d078","year":2021},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:50.944419Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:f496219e7ffb5d92d0ea0b48b55e1a2efc79ebce9177d0ddd2422b9873eea619","observation_id":"65e1d945-a877-4924-b187-f92000682af9","resolution":{"observed_at":"2026-08-06T17:02:05.610724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:05.436433Z","title":null,"venue":null,"work_id":"603e564a-0df5-4199-b2a5-64c859eb74dd","year":2022},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.013714Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:0a2d815fdda96da08ff5d7c9fb35746d85db23a448e6ebf5590daea442f375e1","observation_id":"10e51e21-8079-42e1-a0f1-c70cd65386a1","resolution":{"observed_at":"2026-08-06T17:02:05.476262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:05.414585Z","title":null,"venue":null,"work_id":"4ed2f025-6fb8-4750-ac35-e15330ad7a90","year":2018},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.100813Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:9769cd2c8c5427f74b2577e9a65cbc2a46f9e859ec8e75a5b0bac184500d419a","observation_id":"a3388920-51db-463f-b6b8-7494ffc4bb35","resolution":{"observed_at":"2026-08-06T17:02:05.431098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:51.223100Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.223100Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:53209b3bff78f998dac60bb00b3278198ccd798a70706a4bdd0e097ac5d55cbc","observation_id":"677e940f-1bc0-4e77-bead-21d2308944ec","resolution":{"observed_at":"2026-08-06T17:01:51.223100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:05.217847Z","title":null,"venue":null,"work_id":"341767e1-54e6-418b-9b9c-8273e5e4de9e","year":2018},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.303288Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:91413c61c0c5f721031a19d5011b29a4bb64ef9dc6c9447ea88cb86f9011dc14","observation_id":"e394a4a6-fed5-461a-ae45-e3429aef85fd","resolution":{"observed_at":"2026-08-06T17:02:05.372676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:04.984729Z","title":null,"venue":null,"work_id":"951a9ed9-5ea7-40f6-a9f9-7eccea42a1bf","year":2019},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.366490Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:15f0d7cfc173d7638fbee692a5ef04cedafd3b282a2d2a501f61486736590edf","observation_id":"03c2f0be-e19e-4796-a27a-2b02c0023c55","resolution":{"observed_at":"2026-08-06T17:02:05.064520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:04.936342Z","title":null,"venue":null,"work_id":"ac5dd6f1-c550-4f8f-b264-54f78be0128b","year":2019},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.448402Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:60504155d01446b38547fe2795b37bd187c45837389eb50cdbce65ff37b8e97a","observation_id":"aa14b0af-143e-4365-800e-6484ab06eb1f","resolution":{"observed_at":"2026-08-06T17:02:04.977932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:04.777304Z","title":null,"venue":null,"work_id":"8c19d60d-e2b0-4d03-b28e-9759454b84d4","year":2017},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.518970Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:608a5650e9df57e69a6bd81bec33b922cb068c4cba11f8be38ddbb4f0e0c4f9f","observation_id":"f72a1ff8-bbe0-4717-a50c-35d8cc8425af","resolution":{"observed_at":"2026-08-06T17:02:04.859613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:04.654959Z","title":null,"venue":null,"work_id":"67d99702-50f3-4280-bb82-58fa3aa7dabd","year":2019},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.635137Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:8eaa78a0c19e6470b68b71e83bce526557f61af720cf3c3a143fa65a46c00bfe","observation_id":"d9f78afa-171b-4f85-a9aa-9bd6e7c52e77","resolution":{"observed_at":"2026-08-06T17:02:04.721000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02755","last_updated":"2019-04-04T19:17:04Z","snapshot_observed_at":"2026-08-04T11:21:49.882677Z","submitted_at":"2019-04-04T19:17:04Z","title":"ExCL: Extractive Clip Localization Using Natural Language Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02755","snapshot_observed_at":"2026-08-06T17:01:51.695147Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.695147Z"},"links":{"cited_paper":"/paper/1904.02755","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:46f06ee20d6a9df8cb3fe292420ff2d570f1c76b5383a7355004209515c48c49","observation_id":"9f8a1607-bcaa-4ec2-ac45-d6d6da2b1352","resolution":{"observed_at":"2026-08-06T17:01:51.695147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:04.533267Z","title":null,"venue":null,"work_id":"6973d2a3-24fb-4110-8f86-1f035f732473","year":2016},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.774969Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:004d560514b6984eedb3811906b1462f295a5a29c9340b2705c8023f9ead5675","observation_id":"a0de938f-155a-4030-879e-06ee0875039f","resolution":{"observed_at":"2026-08-06T17:02:04.606939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:04.332186Z","title":null,"venue":null,"work_id":"5e2f73ac-0f00-4296-8adc-f49a1fb88f5e","year":2020},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.837535Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:74be86f88af2a045ce5de26b0edd5ce29d186ae271b60f3d5f300e38f0c593c0","observation_id":"6fbdaf9b-e484-4705-8e38-15e95ceed8ee","resolution":{"observed_at":"2026-08-06T17:02:04.432329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:51.937560Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.937560Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:7bbd9f8b2dbbb3d1a5b38e748abf10900e8ba0f56bca3398e0d3afbb3d9fe90d","observation_id":"fa0f8091-b8ef-4e41-9bff-806d90808a47","resolution":{"observed_at":"2026-08-06T17:01:51.937560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:52.074744Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.074744Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:6f28e9c0e791629edbe0a4658f643a753c79bcc7f6a14d444d31903b6a869b7a","observation_id":"4f00260e-b41b-4320-84fe-b9a7bc717daf","resolution":{"observed_at":"2026-08-06T17:01:52.074744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:03.921499Z","title":null,"venue":null,"work_id":"8be09389-7c05-4e26-b8f7-f70a6181e761","year":2013},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.139783Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:79ad381d5ed69a6f3bd6b3b642c08329de93057b9050f950e3555c798dcc9f80","observation_id":"14965539-9948-44aa-85f4-3b503cefbf32","resolution":{"observed_at":"2026-08-06T17:02:04.005107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:03.676752Z","title":null,"venue":null,"work_id":"f1789b22-ec58-4f75-aaa8-7bd1abff8e61","year":2017},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.198426Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:afc3553218d4f843b456de2716851df83711799b568388a74ae5ec5cc48b39b1","observation_id":"195346d5-6cb4-4e3b-b484-505667a2e5bf","resolution":{"observed_at":"2026-08-06T17:02:03.795675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:03.441470Z","title":null,"venue":null,"work_id":"61fd308f-36eb-4951-9414-9fb2aef7d124","year":2021},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.262998Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:3bc12076976d1390feb9ef9704f7aa3d6f1736011c5fb727ebe6573a15c0f084","observation_id":"1f407d39-6f66-4b22-883e-778238d08b6d","resolution":{"observed_at":"2026-08-06T17:02:03.552113Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:03.212963Z","title":null,"venue":null,"work_id":"795a1b2a-a4a6-4b54-9f81-68315d69ce1f","year":2020},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.329801Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:b951251f0b283043d1c267168775a1911b2abeaf5d2d49f7d03585ac4b835b6d","observation_id":"236f61a4-d600-4788-9607-b0b703b9900a","resolution":{"observed_at":"2026-08-06T17:02:03.315402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:52.392417Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.392417Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:088cfd1bd85690a3e8a5babd4288fff174416463e89039dd57406dc62a115726","observation_id":"42bf14ee-400f-4db3-ae4d-a71024a2ded3","resolution":{"observed_at":"2026-08-06T17:01:52.392417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09093","last_updated":"2025-02-13T09:04:28Z","snapshot_observed_at":"2026-07-06T20:35:49.677643Z","submitted_at":"2025-02-13T09:04:28Z","title":"From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs","version":1},"cited_work":{"arxiv_id":"2502.09093","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.09093","snapshot_observed_at":"2026-08-06T17:01:57.806315Z","title":"From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs","venue":"cs.CV","work_id":"95d71121-97a0-4093-ad0f-5c4f5fa14313","year":2025},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.483519Z"},"links":{"cited_paper":"/paper/2502.09093","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:eb8020f46aef379cc37ebfc922ec82bf905eec75c80a673c8274fd5d51de93e9","observation_id":"555e1e01-2bda-4b0d-a871-6c919cc3702e","resolution":{"observed_at":"2026-08-06T17:01:57.864030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-07-06T21:24:49.058355Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10917","snapshot_observed_at":"2026-08-06T17:01:52.569023Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.569023Z"},"links":{"cited_paper":"/paper/2505.10917","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:1a1da0d810ae96fa83e0546a770a62d85868b3a32e6b8917cf1f2fa022caf27e","observation_id":"67c046c7-93fe-4e25-8faf-bfd9bf4d1412","resolution":{"observed_at":"2026-08-06T17:01:52.569023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:02.861893Z","title":null,"venue":null,"work_id":"0673dc1b-37a4-4a20-8283-1e07440ffbd4","year":2023},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.656033Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:e81ab912b13519b17d66f7a029c94b23e3718957d5127aacc8c228b21d1d9c64","observation_id":"0646cd53-ba31-4c3c-80c3-cb4cceeb6509","resolution":{"observed_at":"2026-08-06T17:02:03.049275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:52.738436Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.738436Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:1ef5d4be90c5cce9b2b087fc2e59d6537013966a645ef8eae93fdc13fdd5ae75","observation_id":"2e6c1423-023e-4de5-aa2a-1ab7bf948fa6","resolution":{"observed_at":"2026-08-06T17:01:52.738436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:02.583689Z","title":null,"venue":null,"work_id":"11b2e19a-894f-42b3-89b1-7e557fa145c0","year":null},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.811438Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:d7553838b8de3736e05066f97de57feca650c75cb448bd9d2c0c4e3832f7d9d0","observation_id":"5691b0ec-177e-4aac-95db-5895a03b1a86","resolution":{"observed_at":"2026-08-06T17:02:02.649380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:02.435245Z","title":null,"venue":null,"work_id":"60d4e417-50dc-4256-812b-ef4f97128dbe","year":2015},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:53.037367Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:355d30a2d7eaa0b7f863f2d9f005a89131033369abc591b11364652c19ae76b8","observation_id":"daad133a-1586-4098-8483-abc4171076b0","resolution":{"observed_at":"2026-08-06T17:02:02.489906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:02.311967Z","title":null,"venue":null,"work_id":"56d55acf-0199-439a-9113-85abc34895ea","year":2022},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:53.135214Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:3b1daac2e10eb9bf6850acca8bc8e1889b2cb47f0b78e807c5e072b713577d6d","observation_id":"c13ef623-c21f-4660-8f1c-23b9544f6441","resolution":{"observed_at":"2026-08-06T17:02:02.366215Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:02.192879Z","title":null,"venue":null,"work_id":"7e56899b-0625-45e9-bdac-1fb0f93611cc","year":2024},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:53.196601Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:adebf1a7c9e41efbf1869fb4c67e39b9e931c557da5f4dcd1e909a7a996392a6","observation_id":"2ea3e324-d1c5-40f2-8e68-00b17135fc86","resolution":{"observed_at":"2026-08-06T17:02:02.254022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20211","last_updated":"2025-04-12T13:16:19Z","snapshot_observed_at":"2026-08-05T19:38:53.163684Z","submitted_at":"2024-12-28T16:48:55Z","title":"Generative Regression Based Watch Time Prediction for Short-Video Recommendation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20211","snapshot_observed_at":"2026-08-06T17:01:53.304316Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:53.304316Z"},"links":{"cited_paper":"/paper/2412.20211","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:b19e25ae354e1d0561b206e2ff398f79e381a06414969c3bd201cd2ef9bae2dd","observation_id":"029ab9d7-e3c4-4422-b445-a63523ee4503","resolution":{"observed_at":"2026-08-06T17:01:53.304316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:02.055039Z","title":null,"venue":null,"work_id":"966d54d8-7f56-4339-8334-6e770f3030c1","year":2023},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:53.367490Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:e9268a47b5a944d1a94cf0ecd4cbb1678b837a93aa2f6a59e80eb058ed7ac90a","observation_id":"c4b61102-18fd-4ce2-9da2-55ae43382a91","resolution":{"observed_at":"2026-08-06T17:02:02.141660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:01.935111Z","title":null,"venue":null,"work_id":"215246be-6df1-4153-a206-7e204fa7026e","year":2017},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:53.452553Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:f18afebdc70c0760b853ce42140283c00672bd9820bf04f3c520d31f43febe0a","observation_id":"b88387db-c596-4279-8d02-dbf51f5df13c","resolution":{"observed_at":"2026-08-06T17:02:01.998097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:01.805179Z","title":null,"venue":null,"work_id":"9c9351a3-81bf-4ac1-9386-e6dccfc7cda4","year":2025},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:53.527613Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:df13d0a9866cb05fa7af8df6a99c5bd58d6794b78eda6401a44fc696b463c3ce","observation_id":"1893d2cf-85c0-42e9-8d58-dd0b71bd7902","resolution":{"observed_at":"2026-08-06T17:02:01.866689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08835","last_updated":"2024-07-03T18:05:02Z","snapshot_observed_at":"2026-08-04T18:08:42.450729Z","submitted_at":"2023-11-15T10:22:35Z","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08835","snapshot_observed_at":"2026-08-06T17:01:53.655769Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:53.655769Z"},"links":{"cited_paper":"/paper/2311.08835","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:4788a8c98039038ebf1936f6131e56938cc3f5ecfdce5afc34a3b3d2102d6f5a","observation_id":"8b8ace74-75e2-41a7-a16c-22585e20c023","resolution":{"observed_at":"2026-08-06T17:01:53.655769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:53.716882Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:53.716882Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:72383f71e37b7782a21718604137f9576316e092eedac6cce389e0cdfc66a0c0","observation_id":"040bec3c-1c6e-4dee-82ce-fddc99118a55","resolution":{"observed_at":"2026-08-06T17:01:53.716882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:01.520128Z","title":null,"venue":null,"work_id":"8e166127-d000-4145-8f65-cf0e969adf04","year":2020},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:53.933142Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:b38fb5807545efe737c0f27a4c0d52b14e62e7b5467c5cbe20a412d87fe70c8e","observation_id":"a2705a62-48c7-4d5e-966b-8297025c396e","resolution":{"observed_at":"2026-08-06T17:02:01.605403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:01.373261Z","title":null,"venue":null,"work_id":"08e7b251-a022-4383-a115-59c8e0dbbb40","year":null},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:54.046348Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:a6b47424307ef5b6ad9b8d5961793f94dfb59b355da21cb4322b7680be9038e7","observation_id":"5c013700-15a0-4b79-9ecf-31131a0778e1","resolution":{"observed_at":"2026-08-06T17:02:01.443661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:01.676618Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"f0f91690-b5a8-4894-b9d7-ba4cec77c77e","year":null},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:53.810467Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:c48638b9c0a92cbb3c7f17edd0e0314d3f003b1c047f88d559c30388ac9565b8","observation_id":"faaaf3d0-28df-4538-902b-c89eb4f020ef","resolution":{"observed_at":"2026-08-06T17:02:01.736228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:54.360770Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:54.360770Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:e24c5e5b2108a1283b8ffc6d7befbf0678c6bbd6d6a403c3b64e591ac63f4358","observation_id":"d55b6c16-4552-4065-87c5-960399a9aee7","resolution":{"observed_at":"2026-08-06T17:01:54.360770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:54.487261Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:54.487261Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:8fb6dd61667dacc1dc2b2ec684b042d11cdd361b64ab4e6fca08295e5f69d576","observation_id":"a6494f00-0a59-4996-8e96-b3ceea5632d8","resolution":{"observed_at":"2026-08-06T17:01:54.487261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:01.023845Z","title":null,"venue":null,"work_id":"41997150-7ca1-44f6-afb9-a08fd6c09792","year":2018},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:54.579323Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:ce716ed940081cd590ab9631946a965b6e30874a756b647e7dafaa6f2a7c3726","observation_id":"67b87124-c407-4299-9b9e-3f62f9a0db50","resolution":{"observed_at":"2026-08-06T17:02:01.114759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:54.261850Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:54.261850Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:f5df464abd4bc955750a3083b883b08c7383e875caedfcd0fd0061268145cd0e","observation_id":"8bb59438-c28b-4f13-8a24-ea6c90092855","resolution":{"observed_at":"2026-08-06T17:01:54.261850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:54.747581Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:54.747581Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:8e1eb109f1c8f2c597a4079b53c24213290714af7b96d860ecd97aad3ab2322f","observation_id":"21ddc416-f038-44eb-b236-555c1d03d87d","resolution":{"observed_at":"2026-08-06T17:01:54.747581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02309","last_updated":"2024-01-05T03:11:28Z","snapshot_observed_at":"2026-08-06T10:16:30.446711Z","submitted_at":"2024-01-04T14:55:57Z","title":"TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection","version":2},"cited_work":{"arxiv_id":"2401.02309","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02309","snapshot_observed_at":"2026-08-06T17:01:57.616303Z","title":"TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection","venue":"cs.CV","work_id":"52764126-79b4-4ffd-aa69-8d4986fe3e66","year":2024},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:54.823917Z"},"links":{"cited_paper":"/paper/2401.02309","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:ee6f1b568e2404cccbda690d0daf01ab3a282e5d89a16b28f2650e3b3aba1a69","observation_id":"b04b19d0-c9b5-4335-b6bd-4056d51c8ffd","resolution":{"observed_at":"2026-08-06T17:01:57.695065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:54.970339Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:54.970339Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:29b7353bdcd63b3955054e7e561116042383b2bcf1dc4cf1b65b6626c5919c36","observation_id":"56d80672-1d52-4f58-94d5-f6ea0fbcd407","resolution":{"observed_at":"2026-08-06T17:01:54.970339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:00.841667Z","title":null,"venue":null,"work_id":"83851f68-cbfa-468d-83d0-95b42476fad6","year":2016},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:54.649962Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:5cee56ce2bb045bf1690ef0ab4b41c29177b6c93fb1723907d80b81e916be64e","observation_id":"12181e44-80fb-40c7-b950-87f686f68b33","resolution":{"observed_at":"2026-08-06T17:02:00.924570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:00.676171Z","title":null,"venue":null,"work_id":"a7d451de-f546-47ea-b993-f2693e8d8c1c","year":2020},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:55.144345Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:a856e0d7043e5d8f5fce70b678833c6cb20395e66ee20e7e953dc5c925ca5e97","observation_id":"395e2ad1-08de-413e-ba2d-5437cd3c9014","resolution":{"observed_at":"2026-08-06T17:02:00.740711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16464","last_updated":"2023-11-28T03:55:23Z","snapshot_observed_at":"2026-07-06T16:53:35.776613Z","submitted_at":"2023-11-28T03:55:23Z","title":"Bridging the Gap: A Unified Video Comprehension Framework for Moment Retrieval and Highlight Detection","version":1},"cited_work":{"arxiv_id":"2311.16464","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.16464","snapshot_observed_at":"2026-08-06T17:01:57.435566Z","title":"Bridging the Gap: A Unified Video Comprehension Framework for Moment Retrieval and Highlight Detection","venue":"cs.CV","work_id":"42a6520e-bcbd-4ca6-b9a3-c4a3161050d2","year":2023},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:55.234016Z"},"links":{"cited_paper":"/paper/2311.16464","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:3874c9b62a447f73a6df242469f73a1340d38af546e94fa46494ba3b160d73c5","observation_id":"7e951564-d320-4930-8534-27fe5ecc8808","resolution":{"observed_at":"2026-08-06T17:01:57.514774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:00.540388Z","title":null,"venue":null,"work_id":"49e141c8-1c78-4ca2-9ea1-eb3c1e901af0","year":2019},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:55.335596Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:abc077a51114c50b6efe398c1bce0cfb22cbe02310b874447d6fb8d72feda4db","observation_id":"b21943ca-7b81-451c-bc21-406c303084bf","resolution":{"observed_at":"2026-08-06T17:02:00.601394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T17:01:55.067828Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:55.067828Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:d7ba7bc087a8b40ce45ec4d147fe332de8938379cf5ec677c49b0dfa1406bf98","observation_id":"713a9ea1-d22d-4f57-97b7-3080719f6204","resolution":{"observed_at":"2026-08-06T17:01:55.067828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:00.186582Z","title":null,"venue":null,"work_id":"f58855d3-38b8-4647-9c86-a3b99b5ce45a","year":2021},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:55.547814Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:108fffece7215dca1908b2082e3628dcae5fe02f5972470c69a313762a9f6776","observation_id":"959f5f75-d4a5-4056-8e02-4f14bb7c40ab","resolution":{"observed_at":"2026-08-06T17:02:00.305060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00355","last_updated":"2023-04-29T22:50:53Z","snapshot_observed_at":"2026-08-01T18:20:11.233649Z","submitted_at":"2023-04-29T22:50:53Z","title":"MH-DETR: Video Moment and Highlight Detection with Cross-modal Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00355","snapshot_observed_at":"2026-08-06T17:01:55.650417Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:55.650417Z"},"links":{"cited_paper":"/paper/2305.00355","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:026c0ad4952e8972a34badf2848f32db422b19d6e04a9cdc4e9c92894440d089","observation_id":"25426ab9-f69d-4e44-8218-ae05f51e583c","resolution":{"observed_at":"2026-08-06T17:01:55.650417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:00.027265Z","title":null,"venue":null,"work_id":"0a1b97d6-83dc-490e-8e18-195139268a4f","year":2024},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:55.734128Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:1320f7da3ef49a174b58acc419761720208b700bc6c503128eabcad64b65216f","observation_id":"825cb218-d257-48ca-b4bd-57b483e64252","resolution":{"observed_at":"2026-08-06T17:02:00.090591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:00.374752Z","title":null,"venue":null,"work_id":"c4ea5b17-e77a-4899-b318-15110b6a09c3","year":2019},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:55.457230Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:2a40ccee5a2a38aba8ce45d5f724b7d547581d00dd983a742fb1558a63849338","observation_id":"49dc8596-fc4d-4050-87a5-1811af1740b8","resolution":{"observed_at":"2026-08-06T17:02:00.462034Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:59.688624Z","title":null,"venue":null,"work_id":"c0456def-5e92-4103-bb85-40b8af13475d","year":2023},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:55.955226Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:c51dde928a8d655db006abe95bba504131980a457d59ff6ada8ab769c73c5125","observation_id":"a1629ad6-a20a-45b2-aa1d-3f594c63e35a","resolution":{"observed_at":"2026-08-06T17:01:59.759065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:59.471573Z","title":null,"venue":null,"work_id":"fe814a43-4f0f-4ef8-938b-feccd37c08ac","year":null},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:56.029153Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:695a5030869dfa2a4a93cec1ac4240210ae703f88aa9bdd6745986e5b05cc439","observation_id":"de3f84a6-c853-4a04-a60f-4ef57f228d3a","resolution":{"observed_at":"2026-08-06T17:01:59.588126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:59.022211Z","title":null,"venue":null,"work_id":"4968c0eb-40b7-482d-a49e-9f2105c2d8f0","year":2019},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:56.215102Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:948364d74e1eed3599eab9357ad06688964b4381d094ae544b10c9beb64d7d3e","observation_id":"6908063b-2c45-4560-8c5e-c6c8524dc170","resolution":{"observed_at":"2026-08-06T17:01:59.142221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:59.837855Z","title":null,"venue":null,"work_id":"9d6dd2f0-86b2-4f3e-8d4b-d344e2f2959e","year":2025},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:55.827167Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:883a9912622915806bcd7619b867e867cceb66723a56c8930fbb37c97cd55ff7","observation_id":"f98da8eb-c6f1-4862-958e-4d7b0f9dd769","resolution":{"observed_at":"2026-08-06T17:01:59.914368Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11435","last_updated":"2024-12-16T04:23:33Z","snapshot_observed_at":"2026-07-06T20:07:32.814148Z","submitted_at":"2024-12-16T04:23:33Z","title":"Learning Implicit Features with Flow Infused Attention for Realistic Virtual Try-On","version":1},"cited_work":{"arxiv_id":"2412.11435","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11435","snapshot_observed_at":"2026-08-06T17:01:57.253188Z","title":"Learning Implicit Features with Flow Infused Attention for Realistic Virtual Try-On","venue":"cs.CV","work_id":"bece7d31-abdb-4127-b7b7-d71cb26fa0be","year":2024},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:56.448712Z"},"links":{"cited_paper":"/paper/2412.11435","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:0c20594b72fbad2f8db85b8b4416b2f8e1466020f499a7f66e4e610d029b902b","observation_id":"057d5f86-c1a8-46e1-8c78-10533682f541","resolution":{"observed_at":"2026-08-06T17:01:57.336574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:58.793499Z","title":null,"venue":null,"work_id":"f2edd845-4864-459b-9d66-f7437b94eb3c","year":null},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:56.544979Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:6a3cf9317fa5eca097ec9400b67d0a2715c2255db0a8281435c122701342f744","observation_id":"cc219044-afe2-4760-b5f7-7b6ee7eed4d1","resolution":{"observed_at":"2026-08-06T17:01:58.832197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:58.481314Z","title":null,"venue":null,"work_id":"f9b52c4c-8ef0-45ea-aeb0-496f90954795","year":2021},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:56.725402Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:4004eed06d1f3c17595d597e9477321b8e02d74bd3d6ef0a8346f586a7d2b7ab","observation_id":"a2de970c-fb7e-47b3-84dd-22fe011d11d2","resolution":{"observed_at":"2026-08-06T17:01:58.574328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13931","last_updated":"2020-06-14T08:49:07Z","snapshot_observed_at":"2026-07-06T09:16:05.338672Z","submitted_at":"2020-04-29T02:47:04Z","title":"Span-based Localizing Network for Natural Language Video Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13931","snapshot_observed_at":"2026-08-06T17:01:56.789076Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:56.789076Z"},"links":{"cited_paper":"/paper/2004.13931","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:11e737ebb3c73c0c196e141b0101470bd0fa1e412bfee54ae7345bca892f774d","observation_id":"69d7761d-49f7-4f9d-bb83-9b7e0e341bfc","resolution":{"observed_at":"2026-08-06T17:01:56.789076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:58.882500Z","title":null,"venue":null,"work_id":"af9917f3-d716-4236-8caf-0a2b93e36f5f","year":2019},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:56.337562Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:85fc00f36e6509b235a05574fb8691925f8307e789365b6040dc3b2468799dd8","observation_id":"077690d4-62ed-4363-9627-aed7707f12e5","resolution":{"observed_at":"2026-08-06T17:01:58.942695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:58.127750Z","title":null,"venue":null,"work_id":"2277e8d6-631e-43a8-b411-ad37772895f5","year":2020},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:56.949824Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:1f8fffc8c4edfe8e811b172261df341f79540a6654ebdbec5f1f85ee1e346cb0","observation_id":"3f9de4f3-abc1-4339-bc15-30a79d98c235","resolution":{"observed_at":"2026-08-06T17:01:58.212372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10122","last_updated":"2025-03-26T10:48:17Z","snapshot_observed_at":"2026-07-06T19:32:46.742766Z","submitted_at":"2024-10-14T03:22:26Z","title":"MuseTalk: Real-Time High-Fidelity Video Dubbing via Spatio-Temporal Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10122","snapshot_observed_at":"2026-08-06T17:01:57.033054Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:57.033054Z"},"links":{"cited_paper":"/paper/2410.10122","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:dd44cc31691b4e35661c81c4c7e10b6d6c6fb92d566fa01e863d238b90dfd500","observation_id":"74d21d0f-12d3-4872-b90f-f88063bff5ab","resolution":{"observed_at":"2026-08-06T17:01:57.033054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:57.943765Z","title":null,"venue":null,"work_id":"b7bef1ef-70fc-462c-a2c4-901ee877fa62","year":2019},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:57.130532Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:a4197a43784fcf96a09a7a0b0d7d8c82f1cbf07f1b7458d765356309db6166f2","observation_id":"54a56479-c594-43a3-8c55-217669de9ec1","resolution":{"observed_at":"2026-08-06T17:01:58.054991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:58.328143Z","title":null,"venue":null,"work_id":"c51b0698-2df1-471d-957d-7a4b779dac9b","year":2016},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:56.912837Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:821f2f5b7fe2db94c5e1deabe0263eb6c3ddbe4a965c68600ece942bf8dd33b7","observation_id":"5b26b043-84b1-490a-a69d-38fa35ca135f","resolution":{"observed_at":"2026-08-06T17:01:58.394459Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:01.198449Z","title":"In Proceedings of the IEEE international conference on computer vision","venue":null,"work_id":"0db6e858-42a3-4328-ac44-45907a5543a0","year":null},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:54.162118Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:1b0ac22579d2dd3491c4ea9643112c248874f5424aaa58120932b897376f8ef0","observation_id":"ac6507d6-ad43-4925-82bd-a6040d969dcf","resolution":{"observed_at":"2026-08-06T17:02:01.273336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:02.572338Z","title":"In Proceedings of the 26th ACM international conference on Multimedia","venue":null,"work_id":"ec48cbd7-6637-4421-94d5-dd444680a00b","year":null},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.922977Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:8d96b49326b21817c8bb796e7f3ef2606b6f28e0c5e365b1a3718dd055b2ff3a","observation_id":"fb217f03-f8e9-424c-873f-6f9b11de6575","resolution":{"observed_at":"2026-08-06T17:02:02.578578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:59.226558Z","title":"In Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"bd70964b-cefc-4d85-ba95-8cbe82789609","year":null},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:56.106557Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:914d5c768e7458a4956926d8359ca945e2b617a53509b2067ec09b059d1a5dba","observation_id":"70807ce9-a57f-4913-8c2c-de0c3c159928","resolution":{"observed_at":"2026-08-06T17:01:59.342757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:04.129952Z","title":"In Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"d698c874-a75b-47e5-9287-d345b1c6f7e7","year":null},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:51.998972Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:86eea0019813e9dd5cadb700e7e1dbe949390b4f1f9892157efa210cddfd693e","observation_id":"3a8182c0-90e1-49c4-959c-ed394fa7956f","resolution":{"observed_at":"2026-08-06T17:02:04.238160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:01:58.660894Z","title":"InProceedings of the 32nd ACM International Conference on Multimedia","venue":null,"work_id":"9eec492e-310a-43ec-9ea5-49bca4cb17f0","year":null},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:56.609835Z"},"links":{"citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:2497f336f5ad638bfd870765e473ee67ccc33edeb40b6dc3218201eb3bff665d","observation_id":"7d288fa9-80d0-42c9-9a2b-9fdab5790305","resolution":{"observed_at":"2026-08-06T17:01:58.720418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:52:40.556769Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":4,"verified_fuzzy":6},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2507.12062."}