{"as_of":"2026-08-08T09:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4606154efc546c8cdb1601693677f6e37913ff6b24c825cdc2a2efa381a23590","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:11:46.728553Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08649/citation-record","integrity":"/paper/2506.08649/integrity","json":"/paper/2506.08649/citation-record.json","paper":"/paper/2506.08649"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.274851Z","title":"Beit: Bert pre-training of image transformers, in: International Conference on Learning Representations, pp","venue":null,"work_id":"2f9ca789-98c9-47bb-8f8b-f1246461b0dd","year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.549152Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:92a428ad74100d799957089805c232134dd1da9c733eaebb8af6a0350a365143","observation_id":"d549bf15-a081-4f71-99d9-3c23b26c444d","resolution":{"observed_at":"2026-08-07T05:11:47.278240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.264952Z","title":"Emerging properties in self-supervised vision transformers, in: Proceedings of the IEEE/CVF international confer- ence on computer vision, pp","venue":null,"work_id":"d9664536-7d9b-4f4a-a8b8-79d6a7f65eac","year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.553980Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:89ebeb1906e238ae089e4973ab9607300d8b020b88211148a4d75171205b9c5d","observation_id":"d4533415-1463-4bb9-ade0-ebc2debd5557","resolution":{"observed_at":"2026-08-07T05:11:47.269193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.255083Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"ca02daec-d084-4889-95d3-9a78ad6ebef9","year":2017},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.557687Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:1bbb903766a106213ecf2acef9ba16b1653f4a16637952b05e2294caf080ab4e","observation_id":"5f6d40fb-6dbc-4058-ade9-bc74f41d3314","resolution":{"observed_at":"2026-08-07T05:11:47.258773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.245725Z","title":"An empirical study of training self-supervisedvisiontransformers,in:ProceedingsoftheIEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"03b909ef-d572-45d7-b71a-e9c697873c1f","year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.561115Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:68fce98cbb41bbafa5b2567c9972eb733de7c6d0a08cb2c881a7b19101cbcc94","observation_id":"781eb04d-9054-47f5-b515-80bf6f8f6ffd","resolution":{"observed_at":"2026-08-07T05:11:47.249109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.235723Z","title":"Videomem:Constructing,analyzing,predictingshort-termandlong- term video memorability, in: Proceedings of the IEEE/CVF Interna- tional Conference on Computer Vision, pp","venue":null,"work_id":"1e384d74-9785-41f6-b851-664c3ea10d2a","year":2019},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.564420Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:3dcdf1346507847fe0c3dcb358b78c8ce06cdce046ca2868d795220e92c8528e","observation_id":"f7f2fcf9-4a59-4e6d-84ee-f354477db27b","resolution":{"observed_at":"2026-08-07T05:11:47.239926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.226568Z","title":"Annotating, understanding, and predicting long-term video memora- bility, in: Proceedings of the 2018 ACM on International Conference on Multimedia Retrieval, pp","venue":null,"work_id":"617404de-b095-413e-945a-d2b5e5f3eb95","year":2018},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.567791Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:38aecdab005501b399ee2146045e5851539cda424f037516a37e62b51e412224","observation_id":"5073d918-1ea4-4e6f-9efb-10efdc8bca9f","resolution":{"observed_at":"2026-08-07T05:11:47.230167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.217770Z","title":null,"venue":null,"work_id":"afec25ae-fadc-4418-9b12-bcf84f7ad90d","year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.571702Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:005c469aa530b1c607ecbab87fbeb0ed0a685b6a98bc928682d9d6bf0772afb7","observation_id":"6095a6a9-f846-4065-a195-77aa90910f05","resolution":{"observed_at":"2026-08-07T05:11:47.220995Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.208591Z","title":"Aimultimedialab at mediaeval 2022:Predictingmediamemorabilityusingvideovisiontransformers and augmented memorable moments , 12–16","venue":null,"work_id":"bd002660-9224-4829-b484-73c0fc286ad1","year":2022},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.574728Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:3ea7aeacadabcb8f20eb82a74b56bd9cbb3c1edbec8a6e7300c39ccd0ed2afe3","observation_id":"3ffd4819-98e8-4c73-b6fe-5d4919e5d333","resolution":{"observed_at":"2026-08-07T05:11:47.212077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.197723Z","title":null,"venue":null,"work_id":"b31e3eb5-db5a-46ca-a79b-5ded6d97f34e","year":null},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.577868Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:9b0464656268d40c2afc55c097dd7840ec00530d0bad190a5e85a42053d9cecb","observation_id":"5ce3ed93-6776-41c0-901a-45c0efaa3776","resolution":{"observed_at":"2026-08-07T05:11:47.201644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.178341Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, in: International Conference on Learning Representations, pp","venue":null,"work_id":"1b32391f-ee61-46b2-99ef-1fd603b22210","year":2020},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.585252Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:5b24f54762d46cdf145e7317f150ffa4d38c3ff7880137371a75bb4308129ee9","observation_id":"6e36c3a1-ad21-47ba-8486-1d1bdfc0bd25","resolution":{"observed_at":"2026-08-07T05:11:47.181724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.168454Z","title":"Modular memorability: Tieredrepresentationsforvideomemorabilityprediction,in:Proceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"8071b60f-6cda-4f75-9661-dc71c0bed64a","year":2023},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.588453Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:ddf63a1041ef028f0e7bfc7484dc4ba0aedea1de1cfd68003791f7d7a2f012b6","observation_id":"2a9e927e-a2ce-4c9b-8ee3-b13738bf9dc4","resolution":{"observed_at":"2026-08-07T05:11:47.171965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.159167Z","title":"Memory: A contribution to experimental psychology","venue":null,"work_id":"f8e4d646-7adc-405f-bf7a-42d0c9d99259","year":2013},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.591673Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:7ff014e90e5d48cacd65dbb70e772b49a488313a403f25b9b09c6ee0e229a0fc","observation_id":"84ec52ee-4516-4af3-b617-78011458f673","resolution":{"observed_at":"2026-08-07T05:11:47.162467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.149679Z","title":"Amnet: Memorability estimation with attention, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"d0fb80a5-ecb8-45a1-ae5b-26e011e4f253","year":2018},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.595240Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:d881178a3f7ed81585b4fb166a7f6b6903734c99a88fe1521f26a1390e13f0fd","observation_id":"de1c3754-e5bd-4c67-8476-58f973fd7335","resolution":{"observed_at":"2026-08-07T05:11:47.153275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.139909Z","title":"Supervised video summarization via multiple feature sets with parallel attention, in: 2021 IEEE International Conference on Multimedia and Expo, pp","venue":null,"work_id":"ba24444c-fa2d-4acc-81e1-efcca5380d00","year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.598319Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:01cfa05036c939da3194b9b9ee5138bb8665e26eeb029a46c78030dc470cf2a5","observation_id":"c0f6c0f8-f23b-4f2e-94c7-236cc1b7868c","resolution":{"observed_at":"2026-08-07T05:11:47.143515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.130330Z","title":"Creating summaries from user videos, in: Computer Vision–ECCV 2014: 13th European Conference, pp","venue":null,"work_id":"4a465127-b3ad-4b63-9545-57353dd7c96f","year":2014},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.601286Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:940215c1c8d791fb9eeb5c052d8e9cba02cb45d4d4c72833a385f8c7f0ef5bb2","observation_id":"be5b7807-0dae-4325-b6c1-3758efa4560c","resolution":{"observed_at":"2026-08-07T05:11:47.133542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.120932Z","title":"Learning computational models of video memorability from fmri brain imag- ing","venue":null,"work_id":"449456b4-1ed7-40a4-aae4-b7536247b9b6","year":2014},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.604322Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:b1b1bbb584b286a0114785cae0f3ba986094d7182e1df04f3e738f38b0f2dca7","observation_id":"fd0c0786-15b0-4c1a-921d-bab3f1d12ecb","resolution":{"observed_at":"2026-08-07T05:11:47.124114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.111416Z","title":"Self-supervised co-training for video representation learning","venue":null,"work_id":"6eef59c7-fbac-46be-a7ea-8b79d4f40bd2","year":2020},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.607559Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:7fd828ee34776ad00f10c05fea378705d9a111661a7db60ad2fb515b17ae1a08","observation_id":"ffe99691-de32-4b92-ba29-32342f3291fb","resolution":{"observed_at":"2026-08-07T05:11:47.114758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.101780Z","title":"Can spatiotemporal 3d cnns retrace the history of 2d cnns and imagenet?, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"eccac6f5-3481-438c-9359-55aef621670a","year":2018},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.611647Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:28b67a93533c64b37ab0a2bedbd56d7643f62b4fef8778a29bb424bb5aff865d","observation_id":"ede9dd67-556e-44a8-a51b-f425d216a1c5","resolution":{"observed_at":"2026-08-07T05:11:47.105493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.092022Z","title":"Momentum contrast for unsupervised visual representation learning, in: Proceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"56270b6b-cfd1-48d8-a078-fd8072f58da6","year":2020},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.614733Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:77c7aec9f7dec5cc11fe9d3ceebe2c10bb935335d4ac4e3ca81ad1937e2937db","observation_id":"d0174df5-c239-4170-b3ba-5ff567d05f2d","resolution":{"observed_at":"2026-08-07T05:11:47.095543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.617686Z","title":"Deep residual learning for image recognition, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.617686Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:0fbb25276e675b23117e0ecf109772bfec853c2446c66f3840eb1f172af6871f","observation_id":"a059f577-50fa-40ae-9079-d16b7f94146b","resolution":{"observed_at":"2026-08-07T05:11:46.617686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.076521Z","title":"Densely connected convolutional networks, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"4348fa80-3cef-4169-9972-93bf1ef5366e","year":2017},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.620718Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:e25b193aecafaf9693261c87f649091ecc7276b33925345727da80df11447b93","observation_id":"8dec3552-4bd3-42df-a5d2-3c1405283945","resolution":{"observed_at":"2026-08-07T05:11:47.080297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.066627Z","title":"Whatmakesanimage memorable?, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"923ecde2-e0bb-4481-bec4-5c99660b4c3a","year":2011},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.624420Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:8f2d610c7a8360b3497d744b497788a1047c79a3de9ce8169dfdcc2ac0cbb150","observation_id":"ce92ed41-a7c0-464d-836a-ce8fd1d80404","resolution":{"observed_at":"2026-08-07T05:11:47.070066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.055708Z","title":null,"venue":null,"work_id":"0f559416-e068-45ae-9597-347fc8366413","year":2019},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.627680Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:6592c5e4cfc9fd580d90cb29352097511b93bbd869ee8a55ea621e9114940f35","observation_id":"2ea92ec0-1555-4f97-9453-a060091b111f","resolution":{"observed_at":"2026-08-07T05:11:47.059531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.044999Z","title":"Understanding and predicting image memorability at a large scale, in: Proceedings oftheIEEEInternationalConferenceonComputerVision,pp.2390– 2398","venue":null,"work_id":"7cfb9022-090c-4e40-8d5d-bd00e567bc13","year":2015},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.630767Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:b23aef670217270240548eb8c3fb40df2b37f58641829cea012041ac485c1c2c","observation_id":"bea60b69-7984-4d34-b94b-86b41c1fe728","resolution":{"observed_at":"2026-08-07T05:11:47.048543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.035469Z","title":"Topic-oriented text features can match visual deep models of video memorability","venue":null,"work_id":"22e3cfeb-3875-4b53-91d1-1971f52dd817","year":null},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.634020Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:d8e06c0a48e32b8204e2651b5bab4697fac3ab96fef8317591be05f77098a006","observation_id":"91762437-a41f-4ea4-89f3-4819249ab71e","resolution":{"observed_at":"2026-08-07T05:11:47.038975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.026321Z","title":null,"venue":null,"work_id":"fbffe811-51a5-4e19-897e-d9de40376ea2","year":null},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.637286Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:716a8de658aa33527c54a02d794f5733a5f7b772f648680184b4b222eceab71e","observation_id":"72896d0d-303f-47a7-862a-0fd231a61be8","resolution":{"observed_at":"2026-08-07T05:11:47.029606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.015732Z","title":"Scene memory is more detailed than you think: The role of categories in visual long-term memory","venue":null,"work_id":"47a1148e-5a38-445b-ab04-2c23b5ed3e7c","year":2010},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.640442Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:f19f8f8d52329b016e02e61c574e1bdc26157d9b5cd7b4282fb3aeffa785af46","observation_id":"48757189-2542-41bc-aac0-c056b1ca5b4b","resolution":{"observed_at":"2026-08-07T05:11:47.020132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.004667Z","title":"Multimodal deep features fusion for video memorability prediction, in: Working Notes Proceedings of the MediaEval 2019 Workshop (CEUR Workshop Proceedings), pp","venue":null,"work_id":"d89bf31a-2b43-4c5b-be80-1d7437cd1544","year":2019},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.643491Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:e0e04271ed10a26508fab4725f24d0fe1c1f2fb42f269c562638004ac473ca24","observation_id":"f08918d2-d602-4c82-9f48-86c00bf63e79","resolution":{"observed_at":"2026-08-07T05:11:47.009187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.994422Z","title":"Adaptive multi- modalensemblenetworkforvideomemorabilityprediction","venue":null,"work_id":"cba9995f-a6f9-4fd4-957e-ddc5e96bec33","year":2022},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.646654Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:466a5fcee187df78fb53618efd5243838d20614ce034b8e48af7a9d3ca39476d","observation_id":"e034b08a-7b4c-4fec-8f8a-0b6c0e015bf6","resolution":{"observed_at":"2026-08-07T05:11:46.998252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.983293Z","title":"Deephierarchicallstmnetworks with attention for video summarization","venue":null,"work_id":"d57992fe-35bd-4e53-84fd-218e9fedbaa7","year":2022},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.649773Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:a4453eef56ca775ede8885a1fd67823bc45185b0e3abe0ab5ef48a5365528338","observation_id":"71079d0d-67ba-4b7e-b32f-27c3ec9ed57d","resolution":{"observed_at":"2026-08-07T05:11:46.988125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.972619Z","title":null,"venue":null,"work_id":"f5f6a893-61fc-4300-9963-d4641519fbca","year":null},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.652766Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:57137204be667136b287c3d111b873b594aeeb1042056d46b7f9e65fdd165640","observation_id":"ff956c57-9814-42bf-b4dd-ec3d6c424eae","resolution":{"observed_at":"2026-08-07T05:11:46.976935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.659487Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.659487Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:36df124460c069e907db2a36fd81d2a31a7aa07444a1559d9d61db5ae09af240","observation_id":"23248fe8-ccad-4499-a197-a514ea451e42","resolution":{"observed_at":"2026-08-07T05:11:46.659487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.940297Z","title":"Video storytelling based on gated video memorability filtering","venue":null,"work_id":"e942d65f-10b6-4c41-9163-6dd28e79a7f4","year":2022},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.666658Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:073556eea27b00bfe2233a435b68d9da174ab839ced60c601676143fadbcae72","observation_id":"91ecfd1f-9f8f-41fa-a58d-052615cc9d23","resolution":{"observed_at":"2026-08-07T05:11:46.943516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.931368Z","title":"Audio-visual instance discrimination with cross-modal agreement, in: Proceedings of the IEEE/CVFConferenceonComputerVisionandPatternRecognition, pp","venue":null,"work_id":"6b4ee3fa-358c-4168-b580-544a4c23c655","year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.669574Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:c1a97ab93cf04d3639894b6979efb03a962aa99e859a3cf5f81712981a509fad","observation_id":"1d0b8dae-449e-4cbc-aff0-1aaf2fabcbce","resolution":{"observed_at":"2026-08-07T05:11:46.934791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.663446Z","title":"10012–10022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.663446Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:32d5e02700fc8ab128303311ecb569864355a28a76305706f0d9d483702dd905","observation_id":"97421f1b-278c-400a-9857-ab4a7a232d88","resolution":{"observed_at":"2026-08-07T05:11:46.663446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.921867Z","title":"Multimodal memorability: Modeling effects of semantics anddecayonvideomemorability,in:ComputerVision–ECCV2020: 16th European Conference, pp","venue":null,"work_id":"9e4d6a2e-f8f6-4888-b692-1be6cd1cab1f","year":2020},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.677044Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:31933ccb1f5d309871acf94662040b587180efd963230bc429e91003cad4c3f1","observation_id":"570c3d7d-ef52-4e09-8b49-7ed65ff3e591","resolution":{"observed_at":"2026-08-07T05:11:46.925463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.912788Z","title":"Spatiotemporal contrastive video representation learning, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"7a0e1847-31f0-43ab-982a-fecf33049aac","year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.680222Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:bfc2ee1d50d62d8e326b8a13a822f6e492fe6848f73f1227e4de0810d2c4d40f","observation_id":"8906cfb4-8275-4239-b9c0-d7363c616322","resolution":{"observed_at":"2026-08-07T05:11:46.916181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09405","last_updated":"2023-09-18T00:08:49Z","snapshot_observed_at":"2026-08-07T22:03:28.039463Z","submitted_at":"2023-09-18T00:08:49Z","title":"Does Video Summarization Require Videos? Quantifying the Effectiveness of Language in Video Summarization","version":1},"cited_work":{"arxiv_id":"2309.09405","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.09405","snapshot_observed_at":"2026-08-07T05:11:46.767006Z","title":"Does Video Summarization Require Videos? Quantifying the Effectiveness of Language in Video Summarization","venue":"cs.AI","work_id":"04e532b0-a3e1-4587-b87f-b69fb964c20e","year":2023},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.672648Z"},"links":{"cited_paper":"/paper/2309.09405","citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:c35af06baa3a1c577f28e4a8f8a1121bf5a66a687fd74c5130f2a4c403b724eb","observation_id":"47a9df1e-e41e-4f9d-b905-a0743f5d9dff","resolution":{"observed_at":"2026-08-07T05:11:46.772873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.893128Z","title":"Self-supervised video transformer, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"7e747fe7-f1dc-4ccb-a1e7-74a0cdf89d70","year":2022},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.686690Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:f7cef556b83de712ff3f9e6d13d1400098f76bde855d50d72e5cdc3f1d8bc313","observation_id":"50758686-3c06-448b-8f17-18b60185de27","resolution":{"observed_at":"2026-08-07T05:11:46.897162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.883573Z","title":"Ex- ploringmultimodality,perplexityandexplainabilityformemorability prediction, in: Working Notes Proceedings of the MediaEval 2021 Workshop (CEUR Workshop Proceedings), pp","venue":null,"work_id":"2fec94cc-e8ec-4367-b48d-ee3da007bef1","year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.689785Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:fdb3ba3089f0168e3e5879a78b561379bad4503fce6ad024c92422030b01c676","observation_id":"6bba91b0-db5e-4035-b671-d0e3647c7f9b","resolution":{"observed_at":"2026-08-07T05:11:46.887360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.903421Z","title":"Learning transferable visual models from natural language supervision, in: International Conference on Machine Learning, pp","venue":null,"work_id":"2058f19a-52b0-4918-b070-d0d7004c819d","year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.683330Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:3ab1e8562c0cf0e04fcbf7d4268e5967866c0b478d6c521b7b1881ad386c168d","observation_id":"326a40c3-738d-40ba-a555-8067694ee21c","resolution":{"observed_at":"2026-08-07T05:11:46.906842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.864524Z","title":null,"venue":null,"work_id":"81dd85e0-0003-4611-beb2-abe430e3c60f","year":null},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.695940Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:576bd1a26cb0e347e8d44aa66250e11569133091c47cb0c5c90012c78fcc4712","observation_id":"5c39147e-8b28-4b8b-9caa-19a1c1050184","resolution":{"observed_at":"2026-08-07T05:11:46.867763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.844767Z","title":"A network linking scene perception and spatial memory systems in posterior cerebral cortex","venue":null,"work_id":"484bb644-f877-4586-b783-19e86035a357","year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.702055Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:e527cf302ae2bbb8b15d9987c02106892c4f57ee0f5a83d202922fe0147307b6","observation_id":"e2f732db-0da7-458a-8223-282ff3392ce8","resolution":{"observed_at":"2026-08-07T05:11:46.848255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.874083Z","title":"Tvsum: Summarizing web videos using titles, in: Proceedings of the IEEE conference on computer vision and pattern recognition, pp","venue":null,"work_id":"b40d5024-8fff-47c5-954c-1ece2693310d","year":2015},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.692753Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:7d0fab818f74e99f01a8c0fa20f20d9b2d8caab9b53e8433e06989ab2ef63f91","observation_id":"afbe63c6-0be1-47be-af86-05dae2b3d1fe","resolution":{"observed_at":"2026-08-07T05:11:46.877589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.825735Z","title":"Predicting media memorability:Comparingvisual,textualandauditoryfeatures,103– 105","venue":null,"work_id":"fceaa5a2-206b-48ab-b804-3590e2efa941","year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.708918Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:74cec63e6d17b064703b1141291342334978e0f0cf497c85459170f57bac50f8","observation_id":"d06d11f4-aae0-4123-9feb-a02475e4e491","resolution":{"observed_at":"2026-08-07T05:11:46.829024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09308","last_updated":"2022-12-19T09:10:23Z","snapshot_observed_at":"2026-07-06T14:32:18.104077Z","submitted_at":"2022-12-19T09:10:23Z","title":"Diffusing Surrogate Dreams of Video Scenes to Predict Video Memorability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09308","snapshot_observed_at":"2026-08-07T05:11:46.712366Z","title":"Diffusing surrogate dreamsofvideoscenestopredictvideomemorability","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.712366Z"},"links":{"cited_paper":"/paper/2212.09308","citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:6be64de035c82928def987fa9983b5e192000a60ddf5cd59845f8af8f070e1ab","observation_id":"929fe93a-ef38-4ba4-8e2b-b044a5a33f5e","resolution":{"observed_at":"2026-08-07T05:11:46.712366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.815958Z","title":"Siamese image modeling for self-supervised vision representationlearning,in:ProceedingsoftheIEEE/CVFConference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"77a02449-5d2d-42d1-bfc3-91ab02e706bd","year":2023},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.715755Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:c5be24c1f62272045bd96dd2923ef1e2f05b6689dd29b0c49d86c3b87ee394df","observation_id":"6c5972c9-04a2-4f90-b2b6-8b390cfe2712","resolution":{"observed_at":"2026-08-07T05:11:46.819385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.835022Z","title":"Recurrent unit augmented memory network for video summarisation","venue":null,"work_id":"6e9173db-407a-4cd7-8733-06eddfa8ab90","year":2023},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.705054Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:cf3f8ab56ff9adbf74269d265f9c2dcaf78b6f7400b94cfa957d6f232c4a899e","observation_id":"88fcf709-254d-43dc-94db-1cbe309cd1de","resolution":{"observed_at":"2026-08-07T05:11:46.838910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.800344Z","title":"Modelling of video memorability using ensemble learning and transformers , 7–11","venue":null,"work_id":"1d0d693b-98b1-443b-ad46-5f5203a4844c","year":2022},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.722577Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:00a0bd32056757ebdb7d9d5bf52c45c8784873a204f014d77a4390c7258f89a5","observation_id":"3c5dd633-7268-40ca-b90e-a4cbc551ed13","resolution":{"observed_at":"2026-08-07T05:11:46.803999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.790459Z","title":"Reconstructivesequence-graph network for video summarization","venue":null,"work_id":"563ac2ff-461d-4e78-ae94-b575f55d5f9e","year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.725551Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:3901c0a8a70c8fbf05cf6a6eea0bab76773038758d92465c0da8e1c3dd35b776","observation_id":"7f3b7039-30bb-47c2-9dd0-42c8088d0041","resolution":{"observed_at":"2026-08-07T05:11:46.793870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.780563Z","title":"Learning multiscale hierarchical attention for video summarization","venue":null,"work_id":"78815a56-be3a-49f4-b458-41b09476b20d","year":2022},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.728553Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:850225b72b4dd3bb754e6357f2e4e84a2d3fa75f758dee983632e4a9512d2bf0","observation_id":"47d8ed23-a8be-460a-9a4c-4d5c6f4ef6b5","resolution":{"observed_at":"2026-08-07T05:11:46.784016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.718784Z","title":"Training data-efficient image transformers & distillation throughattention,in:InternationalConferenceonMachineLearning, PMLR","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.718784Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:1cf6ffcc9cb385f038e79ace49c7c65c187a9971a92c08d19aecb88e9800ecb0","observation_id":"4f87002f-97f5-4cc9-a326-97089498140c","resolution":{"observed_at":"2026-08-07T05:11:46.718784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.854432Z","title":"2371–2375","venue":null,"work_id":"2f1ffc54-899d-449b-83dc-d9d7b923b334","year":null},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.699116Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:53b05d56c30d35e5efe581fb13a247282a704050d4fd9677144e7face0ac3a0c","observation_id":"71f02226-52a6-4ebb-824f-cb86936bc0d2","resolution":{"observed_at":"2026-08-07T05:11:46.857713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:47.187588Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence 44, 4065–4080","venue":null,"work_id":"77803290-b20a-4e77-8db6-ff69ae7c62d3","year":null},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.581336Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:e79404a3be2b0692fd880c23071aecc621295f1fcb6d873cbda0eea28719ff5b","observation_id":"7cf91807-10fb-4bf6-88e2-4e356758669b","resolution":{"observed_at":"2026-08-07T05:11:47.191839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:46.961398Z","title":"IEEE Transactions on Image Processing 31, 1573–1586","venue":null,"work_id":"d80da6c8-ec7f-417a-a098-3a527ef18fcf","year":null},"citing_paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:46.655922Z"},"links":{"citing_paper":"/paper/2506.08649"},"observation_digest":"sha256:eda07b3dcd10dd10bee924672c34ba24cac64a45d15a576d2486c902c7744dfa","observation_id":"b9de527e-2891-4ccf-a400-2d771e263e9a","resolution":{"observed_at":"2026-08-07T05:11:46.965734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08649","last_updated":"2025-06-10T10:01:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:03:02.691239Z","submitted_at":"2025-06-10T10:01:08Z","title":"Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":43},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2506.08649."}