{"as_of":"2026-08-23T22:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7990a1b927197649d1527111b02abc07989b6d20fdbc1cb4ffb16af54c758388","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:50:12.188418Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.14553/citation-record","integrity":"/paper/2504.14553/integrity","json":"/paper/2504.14553/citation-record.json","paper":"/paper/2504.14553"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:11.935065Z","title":"Localizing mo- ments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.935065Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:9482e963ae7f46a790e0622523bfb45a75e7cb6205f349876af40b257b0e3892","observation_id":"ff6acc08-898c-4ae0-9029-d57bb21daa57","resolution":{"observed_at":"2026-08-16T11:50:11.935065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.936570Z","title":"Boundary content graph neural network for temporal action proposal generation","venue":null,"work_id":"dd7294c6-b084-4046-a83b-4f35a93cf7eb","year":2020},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.940177Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:3d115a570832593619cdb03923c12ed0f98dbd8dadaf7cf67dda104f028352bd","observation_id":"f0e13720-1928-45a9-86dd-75ba2afe9f44","resolution":{"observed_at":"2026-08-16T11:50:12.940912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:11.944566Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.944566Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:66edca63d1454bdbda4e0137f679fbf8018f9716d6f034f58e2c126840611c09","observation_id":"df77c5e4-7a07-454c-b8a8-f91ac01b52b7","resolution":{"observed_at":"2026-08-16T11:50:11.944566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.913119Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"aeaa34a6-7fb8-401d-a610-21ddba05e0f2","year":2015},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.948975Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:d3977f6a7a9c836db1e66bb902a9f961da5b7e7e72c3cfeae7fc4aa3c6c6e67a","observation_id":"08cea097-311e-41dc-a647-abdd6cc434c3","resolution":{"observed_at":"2026-08-16T11:50:12.917568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.900023Z","title":"Conceptual 12m: Pushing web-scale image-text pre- training to recognize long-tail visual concepts","venue":null,"work_id":"e4ba1845-29a2-45cb-9370-c4cc7cf27d4e","year":2021},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.953584Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:ad7624f00633df3854e50dc72050d4d1ea2c1c438c472a616a347e00114d099a","observation_id":"658e8f35-3558-4537-9c3a-8055ef4a7af5","resolution":{"observed_at":"2026-08-16T11:50:12.904327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.886552Z","title":"Tallformer: Temporal ac- tion localization with a long-memory transformer","venue":null,"work_id":"107a2343-a046-48ef-884b-7339056fbcde","year":2022},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.958554Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:59102d66e6a1a8882c025fdef0e30cfaee72971785775e453f0cda4f803ccdb0","observation_id":"3c77918f-81cc-4e1d-8347-09e1f7b829a8","resolution":{"observed_at":"2026-08-16T11:50:12.890742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.873375Z","title":"Vindlu: A recipe for ef- fective video-and-language pretraining","venue":null,"work_id":"80f6149d-9681-4ed3-928d-abee2999ca5c","year":2023},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.963159Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:e523cc326c9b3c51ac0c52a31df15637e87c4fd2a3255183366cf0b0dc11be7f","observation_id":"e11e8444-c6d8-4973-ae27-f74025a37496","resolution":{"observed_at":"2026-08-16T11:50:12.877658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.858501Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"96e83a03-78c7-4494-8757-874d16417149","year":2019},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.967899Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:a08a1328fbfcebe7258363eccca04f24d388980c80e4f2a50abdc2f57f766a72","observation_id":"cf8286c5-9cd7-4431-b86b-0ea317814ccb","resolution":{"observed_at":"2026-08-16T11:50:12.864111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:11.971950Z","title":"End-to-end learning of motion representation for video understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.971950Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:98f95593e395da5b87924c7356eb893393ab7ac39b83ce32c7d7564430e8c161","observation_id":"d0402a72-4fe6-4d3e-b4ee-84a64b963430","resolution":{"observed_at":"2026-08-16T11:50:11.971950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.835665Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"37e42c16-fcc1-430a-a86a-176be0efb5d4","year":2017},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.976006Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:21c67a752323fdc45252f88ffb5e1bf59b4f1fb8e6d2f4795ab15845a5f83598","observation_id":"07b6cf7a-9704-4c7d-8a74-8db79551633c","resolution":{"observed_at":"2026-08-16T11:50:12.840209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.820992Z","title":"in the wild","venue":null,"work_id":"dbf261f2-ba7f-4c06-b4de-f6748526abb5","year":2017},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.980125Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:4fa4d7582088442fd04fb7455db4fd8132b00412b6e2c93413b07a2634b5218d","observation_id":"660646cb-6379-487f-be8e-4bbb50558477","resolution":{"observed_at":"2026-08-16T11:50:12.825150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:11.984434Z","title":"T-rex2: Towards generic object detec- tion via text-visual prompt synergy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.984434Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:efbe35cadc011245c82854dfe8488dd61c38c1a2a7276291b5ad3ce216851067","observation_id":"9609bb16-1aa7-416f-820d-7f0bd7386e1b","resolution":{"observed_at":"2026-08-16T11:50:11.984434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.798182Z","title":"Prompting visual-language models for efficient video understanding","venue":null,"work_id":"6080bd36-0a19-4ec5-99ef-8df886426882","year":2022},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.988563Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:718da74bcd4d7264a0b1db48690e4ccc730a5e94aa73d883d085941dd7655602","observation_id":"084166b9-93db-4129-8882-125be8f4183a","resolution":{"observed_at":"2026-08-16T11:50:12.802754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.782929Z","title":"Dense-captioning events in videos","venue":null,"work_id":"7b4c49e5-ef2b-49ef-a07b-0e01ab118531","year":2017},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.992614Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:0a3cbb577a79da3a03cefa6241ba4fefb1578e3cdf623629a9f2339d98c1154c","observation_id":"178afd0a-52a8-4b11-b021-c28885dd72f2","resolution":{"observed_at":"2026-08-16T11:50:12.787985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-16T11:50:11.996936Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:11.996936Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:bf9e399969093b3a3452035b6dfa34d4637edcc13390fc5ce60009115f7abfca","observation_id":"4ff0dbfe-99f5-4758-a122-9aeb10c15eb2","resolution":{"observed_at":"2026-08-16T11:50:11.996936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.768213Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"b0309272-812b-4595-8e52-3c076708f2bf","year":2023},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.002095Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:c0bd8c0dc121408b307f7f478734c3a6b6669c489d56868567f078a92c5a870a","observation_id":"858e4a86-03dd-4367-9de3-edb0737d1eba","resolution":{"observed_at":"2026-08-16T11:50:12.772567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.754810Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"c089694d-6815-43b5-9a8c-794a63c691bc","year":2024},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.006085Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:dd89549be9789c0d734ec7bc9a4a80b29368af82f3037eddc1612801452046cf","observation_id":"2a6bc45b-887f-407f-b02c-6b591c815850","resolution":{"observed_at":"2026-08-16T11:50:12.759155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.740729Z","title":"Grounded language-image pre-training","venue":null,"work_id":"5dda87fd-a869-4771-b51f-2d66c4c5d8df","year":2022},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.010107Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:5d7258c5efb317a5f497f64ec6792d5da28aebcc5b3064e7947c96bb7d70bea8","observation_id":"dddf181c-cfef-475b-a87c-eae5063a370a","resolution":{"observed_at":"2026-08-16T11:50:12.745672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.727239Z","title":"Detal: open-vocabulary temporal action lo- calization with decoupled networks","venue":null,"work_id":"85d12982-6245-447f-9349-65ec3336f6db","year":2024},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.014198Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:83441000b91d4eabb42b4b645ab0d8087c527f544f3b8d92b946d3deb401999f","observation_id":"e2326f9c-a21e-4f9c-9d64-796a67edefe8","resolution":{"observed_at":"2026-08-16T11:50:12.731870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.713498Z","title":"Learning salient boundary feature for anchor- free temporal action localization","venue":null,"work_id":"08ba56f6-847d-4979-a0cc-806984cfb4dc","year":2021},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.019042Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:329f8ec895ddb90d28bebb32249ae5f65a449c51f2cc7d5f5239e30710cd19c9","observation_id":"6a64592b-ffe5-4217-89ae-bc456465e19a","resolution":{"observed_at":"2026-08-16T11:50:12.717853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.023159Z","title":"Tsm: Temporal shift module for efficient video understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.023159Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:f698ea8cf739c687f63ba1a9fa88a0bd3167abebc719075063db541f0776c6df","observation_id":"357ce09c-b620-473f-bb54-4355dd7f0a32","resolution":{"observed_at":"2026-08-16T11:50:12.023159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.027367Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.027367Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:20f0cd18f45c99f8f602eccdd9ee696f590a0f715b57146d4a820c0ac5f55a41","observation_id":"1e3ed86d-c28e-45fb-9936-2273393539ee","resolution":{"observed_at":"2026-08-16T11:50:12.027367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.682876Z","title":"Single shot tempo- ral action detection","venue":null,"work_id":"76ba21d1-ac32-48ca-a666-549c80bf3ee7","year":2017},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.031568Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:d8e91e952f6093b4e298bb9b6580c66401b91ace733b89ab755445317090d6d2","observation_id":"2347ab74-c07c-4f6c-84f6-0ae9820ffe81","resolution":{"observed_at":"2026-08-16T11:50:12.686993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.035641Z","title":"Bmn: Boundary-matching network for temporal action pro- posal generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.035641Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:f683773dae2f59992163b11bd825c32a538a1324b6338fb8cfb9b8368be84321","observation_id":"8656353c-c7b3-4b6d-a36d-4f8a7e93d3c0","resolution":{"observed_at":"2026-08-16T11:50:12.035641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.039984Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.039984Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:85233fe634c6fca47bd5d5f7b3f28254dd43c5e7326b6ed6b18d661d25e95602","observation_id":"47621ad1-fd99-4c7e-b9f6-bb4c2a3d2bfc","resolution":{"observed_at":"2026-08-16T11:50:12.039984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.653210Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"5ecb8da7-7365-43ef-8bed-9666239c9171","year":2024},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.044191Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:04763bcf3fe29d769a43eb8a11d73e592b314e8843f10d4215577bed2f8daf0b","observation_id":"bf5fdd36-f2d4-4aff-8841-0fe11f45a718","resolution":{"observed_at":"2026-08-16T11:50:12.657546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.640068Z","title":"End-to-end temporal action detection with 1b parameters across 1000 frames","venue":null,"work_id":"2ad39dc8-5827-4905-b7e4-012bc0dd0dc8","year":2024},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.048533Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:b7c76fdd0c8105dfc41b6d0357ccd25b3b4d04a38554ab0cf957b9ed5a3e4b35","observation_id":"3b4eb629-b65c-4e19-ae26-6ee52a125700","resolution":{"observed_at":"2026-08-16T11:50:12.644427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.626626Z","title":"An empirical study of end-to-end temporal action detection","venue":null,"work_id":"69a3d9cf-e1e9-4d9a-8e44-36dd1635e8f7","year":2022},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.052601Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:a55a02dc691c54f20b6a9d725513e734f98e4ecece84a2c4e5a28c63bdcac1d7","observation_id":"cd97fa05-a8d4-49d2-9f87-c17f7b56e8a6","resolution":{"observed_at":"2026-08-16T11:50:12.630764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.613591Z","title":"End-to-end temporal ac- tion detection with transformer.IEEE Transactions on Image Processing, 31:5427–5441, 2022","venue":null,"work_id":"0b482634-834f-4ac0-8445-f7e0427b46ea","year":2022},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.056818Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:f992d3c33625d6d338bd65ebd9955a6ac343c4c446759f8a4bed03da99f77be9","observation_id":"18234106-3f50-4670-81aa-8f358e43d1a9","resolution":{"observed_at":"2026-08-16T11:50:12.617840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.060843Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.060843Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:17edfc2a47287ee9e5d57375dff8fa2de0b0ee332fc0c46dc540f908e11e8203","observation_id":"38ffb9e2-8104-4f0b-9a22-8f88d600f0ff","resolution":{"observed_at":"2026-08-16T11:50:12.060843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.592200Z","title":"Fineaction: A fine-grained video dataset for temporal action localization","venue":null,"work_id":"88f22597-db07-45c7-a820-b42518a840ee","year":2022},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.065214Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:8b93466e14029e02ead7a5d99e400b968c65166a5bf041f907689d3c27b9332b","observation_id":"32f8dd08-93bd-472f-b755-fbb32083ec25","resolution":{"observed_at":"2026-08-16T11:50:12.596485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-16T11:50:12.069248Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.069248Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:12e3da2bd3609af9516a62ddd04198487e6c7faf815136b5e128ce1d000b2d5a","observation_id":"39fbbbe0-5869-48c1-96d7-3d761f13c087","resolution":{"observed_at":"2026-08-16T11:50:12.069248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.577547Z","title":"Towards generalisable video moment retrieval: Visual-dynamic injection to image-text pre-training","venue":null,"work_id":"59d63dcc-69b7-4368-9d4c-8df49131023e","year":2023},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.073330Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:d64f56499272a4a7a1b3c4d0e205f027333900983320610c6d8463c73ab1e659","observation_id":"c560b90d-9e59-4f4c-804b-1234c681e8f8","resolution":{"observed_at":"2026-08-16T11:50:12.582753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-16T15:24:32.944943Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-16T11:50:12.077492Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.077492Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:87ed7a002e9f571d986124ff779bd8747c6a7eac278a9474ff17d8c3f1295f3d","observation_id":"2e37c068-59d9-4c0f-9b1d-cfd7baf896a2","resolution":{"observed_at":"2026-08-16T11:50:12.077492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.082162Z","title":"Local- global video-text interactions for temporal grounding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.082162Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:3fdbb07c0bb817115a40d0c1c31b63e6112c9590a8a3c25efd9558dab344290c","observation_id":"93bcd896-c203-4d59-ab08-f32a11c4296b","resolution":{"observed_at":"2026-08-16T11:50:12.082162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.555665Z","title":"Zero-shot temporal action detection via vision-language prompting","venue":null,"work_id":"66d26654-55d8-4901-9c89-6fbfded23678","year":2022},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.086313Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:f3396f28178c6202c4bef1a7a8554db5c59836cc6fb2e9b9723925a48646d5c4","observation_id":"ccc8222a-f8fc-4507-aea1-9c0035738b10","resolution":{"observed_at":"2026-08-16T11:50:12.559976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-16T14:17:41.002456Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-16T11:50:12.090885Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.090885Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:3da1eff07954a90825e7437873dfbfe483519c86cfbe9bdb86ef845ea8ef3be2","observation_id":"53bcc1ca-7d58-498b-8e3e-6180ca02c5f5","resolution":{"observed_at":"2026-08-16T11:50:12.090885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.095814Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.095814Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:97a14ed14379d0f17f75f02f6ef01ff9fbe8510625788fca90439e2d24c0bb64","observation_id":"704614e2-b4dd-45cc-ab92-4d7fb5de9683","resolution":{"observed_at":"2026-08-16T11:50:12.095814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.099801Z","title":"Action sensitivity learning for temporal action localization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.099801Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:3c09472e25c7e6164990b8c66a5ad71ff78960adf2781499267c1b9c6a5c43c8","observation_id":"ee6e1fd8-a83c-4c4d-aea8-76e3142a7f0a","resolution":{"observed_at":"2026-08-16T11:50:12.099801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.525269Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"f99dc691-f14d-4ddd-8fb6-a4cad86e5569","year":2018},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.104055Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:1dfc02c734dbce2b791ca81a6e43074dea7961a4f922bc8f918761a6031878c9","observation_id":"aca31db7-1f00-475c-9d08-e9018784dd56","resolution":{"observed_at":"2026-08-16T11:50:12.529824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.512191Z","title":"Tridet: Temporal action detection with relative boundary modeling","venue":null,"work_id":"8df29dee-7a96-4d58-88f8-79745174bda7","year":2023},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.108083Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:08731a1eeb2aa3b6751b2a02438aaa241e4f2cd6a7dddbe53dbc75c615f299a8","observation_id":"db9fe65e-e596-4c62-bebd-c5361b85c16d","resolution":{"observed_at":"2026-08-16T11:50:12.516305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.112142Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.112142Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:da03070e7701cc393673c914216d8f53ac7ea55db0c616c45a4e723a1d943114","observation_id":"8772812d-fe1e-4bc0-a66a-2b73c5e46dd3","resolution":{"observed_at":"2026-08-16T11:50:12.112142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.116244Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.116244Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:9ffffef3a872f488264dd0753ce6b00f09460f3de295a315019cf7986746fe40","observation_id":"941ccdad-9b86-4eaf-b617-de3919e7f0cc","resolution":{"observed_at":"2026-08-16T11:50:12.116244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-18T03:30:52.103954Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-16T11:50:12.120166Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.120166Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:4fabacb2ceb7b589377bddfd449a8fe8c2f0864f197ee171e98620a9718550b6","observation_id":"537cd032-6373-483a-825c-aab3c70f68b2","resolution":{"observed_at":"2026-08-16T11:50:12.120166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-08-19T18:30:11.337554Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-16T11:50:12.124563Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.124563Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:c2ec85177324984148d36a850f87959ba053247cf4cad058063a25eb3f0e0657","observation_id":"6d8d9532-581a-4436-92de-8396b86cd79a","resolution":{"observed_at":"2026-08-16T11:50:12.124563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-16T11:50:12.128948Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.128948Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:ef0cb75fa53902ff00cbf24b5ff610d75399915d3c3d5382d3b7e87b4849aabd","observation_id":"739c4d95-ae11-437e-ab3d-0315a537f523","resolution":{"observed_at":"2026-08-16T11:50:12.128948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.481350Z","title":"Learning to refactor action and co-occurrence fea- tures for temporal action localization","venue":null,"work_id":"da358639-fbce-469c-8d55-ee621067ac82","year":2022},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.133094Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:82b44e439d5aeb6ea207b456ad6c122df5939583d12f7676d59f48b4bfb23cb9","observation_id":"9679374f-8457-46e5-a818-bda04611e9a7","resolution":{"observed_at":"2026-08-16T11:50:12.485818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.467026Z","title":"Unloc: A unified framework for video localiza- tion tasks","venue":null,"work_id":"56d925fa-72af-47e3-892a-127987b2f736","year":2023},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.136883Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:6b99e97147da73f14162e77cad32a26c536d127e3d4c9c5dd025730d6b1a333b","observation_id":"ae7d4550-78fd-452f-b34e-9ac9f0ff334f","resolution":{"observed_at":"2026-08-16T11:50:12.471428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.453136Z","title":"Basictad: an astounding rgb-only baseline for tem- poral action detection","venue":null,"work_id":"a9a8a9e5-7dd4-487c-bb06-60c6022d6483","year":2023},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.141418Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:6b8caabcde8b123b1abbdb6106f510493587ab3ed9a99667d654e86d330cc609","observation_id":"900d7373-058c-4c5a-84e0-1a4d3b8d4034","resolution":{"observed_at":"2026-08-16T11:50:12.457825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.438848Z","title":"Detclipv3: To- wards versatile generative open-vocabulary object detection","venue":null,"work_id":"75220a31-47f7-4072-8c57-938abe75b89c","year":2024},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.145534Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:dffc3257ff123c996a4189380cc314b8a7e5c551bb8f56968eea5e3ecca57811","observation_id":"dbaeb6b5-e803-49a0-bd41-e7ae532faca2","resolution":{"observed_at":"2026-08-16T11:50:12.443421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.150258Z","title":"Semantic conditioned dynamic modulation for tempo- ral sentence grounding in videos","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.150258Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:8c35dd5cf4016b02db2eef002dffd6291aa3d455e355610609183c055f3fb159","observation_id":"fe123d0a-b629-4d54-9574-a435d9734cd6","resolution":{"observed_at":"2026-08-16T11:50:12.150258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.416691Z","title":"Graph con- volutional networks for temporal action localization","venue":null,"work_id":"0af7ad79-ad35-4204-b0ee-362e60c1afc8","year":2019},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.154906Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:cec90eab45a6aab4de3dd223327892cb626ea0e498ca833566de34b1b258c9ef","observation_id":"8bfbcb11-769e-4293-8ec2-9b0570a481b5","resolution":{"observed_at":"2026-08-16T11:50:12.421012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.159390Z","title":"Dense regression network for video grounding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.159390Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:6895986c32bd0ecb226dbccdbac21c0e5026cf2759bc2b8678218303e9398bc6","observation_id":"e8639064-53de-4d74-991a-83d9d2e4c7cb","resolution":{"observed_at":"2026-08-16T11:50:12.159390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.394499Z","title":"Unimd: Towards unifying moment retrieval and temporal ac- tion detection","venue":null,"work_id":"b7b41ebd-af4e-4c6c-bd7e-55f75886a1f9","year":2024},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.163620Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:e9cabbe14dbfcfd6dbf39c5bc954e9275867750d7c2e814e04b943109e02ad5f","observation_id":"df438b76-7cb8-466f-9a6c-b5bc4ccfbe76","resolution":{"observed_at":"2026-08-16T11:50:12.398852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.167717Z","title":"Actionformer: Lo- calizing moments of actions with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.167717Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:e60add90bd53cef04daa9a7038337439ef51c62bfb174ecc2902132f73516ed1","observation_id":"982e96c6-3a4d-47e7-b8f3-56993819cb5b","resolution":{"observed_at":"2026-08-16T11:50:12.167717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-16T11:50:12.171758Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.171758Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:b6e8081abb246cff27cf4ba6ba90f69515ffa195fe4af761206347f0f8d96e90","observation_id":"a5c32f57-678f-4876-9b73-922107083c3f","resolution":{"observed_at":"2026-08-16T11:50:12.171758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.372115Z","title":"Learning 2d temporal adjacent networks for moment local- ization with natural language","venue":null,"work_id":"d5654577-3607-4602-b057-3a900bb7996c","year":null},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.175940Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:54852be5c580362b3d9bb91581d10f668f103e5f00797fea8bfaee0d64a5e173","observation_id":"03f4f722-528f-4aef-af00-43f5aabe29fa","resolution":{"observed_at":"2026-08-16T11:50:12.376418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.358258Z","title":"Hacs: Human action clips and segments dataset for recognition and temporal localization","venue":null,"work_id":"300f228e-48a5-4702-b8bc-d3bf76c7e085","year":2019},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.180563Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:c5c4b645654de92933ac1989ee2adbefd20962a81eff1ad362077bdfacd0a394","observation_id":"60f187a1-fe2d-4004-abd5-18bdc29a4533","resolution":{"observed_at":"2026-08-16T11:50:12.362814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.344072Z","title":"Distance-iou loss: Faster and bet- ter learning for bounding box regression","venue":null,"work_id":"bc95a442-4cb1-40a2-9a2a-46996c58fc5a","year":2020},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.184512Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:9a387b7f8fe89f25613dc412f74baf21c3bf8cf59085ee31c0da0d550154555a","observation_id":"d25f12e9-52ae-4d3b-b006-57dde7b74ee4","resolution":{"observed_at":"2026-08-16T11:50:12.349016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:12.328338Z","title":"Enriching local and global contexts for temporal action localization","venue":null,"work_id":"5f523961-d22a-4847-ae1b-04d68c9d2fa4","year":2021},"citing_paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:12.188418Z"},"links":{"citing_paper":"/paper/2504.14553"},"observation_digest":"sha256:d80429c40805436a4ab8e295aaceb061b21fb22fcf6f5710c028dcbf25159f8a","observation_id":"a39519a1-9e4f-4c62-8deb-c1b9232acb08","resolution":{"observed_at":"2026-08-16T11:50:12.334504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.14553","last_updated":"2025-04-20T09:54:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T18:30:53.027473Z","submitted_at":"2025-04-20T09:54:25Z","title":"Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2504.14553."}