{"as_of":"2026-08-08T01:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d24574bd767f5c778c831190be2c33ae0855d1385b64f03a085249eb234fc250","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:54:19.856159Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23268/citation-record","integrity":"/paper/2505.23268/integrity","json":"/paper/2505.23268/citation-record.json","paper":"/paper/2505.23268"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:25.435725Z","title":"Align and attend: Multimodal summarization with dual contrastiv e losses,","venue":null,"work_id":"677ec4c6-5b82-4e21-afde-43605194a970","year":2023},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:18.096395Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:a413a5e48a01d22a170c80d3a589513a9f1f822c6f01fec4ac374393fb0917a3","observation_id":"255ca5ff-7fb4-4850-be8d-db87a2bb0e1a","resolution":{"observed_at":"2026-08-07T12:54:25.528941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:25.219681Z","title":"Clover: T owards a uniﬁed video-language alignment and fusion model,","venue":null,"work_id":"722cf638-510e-43a1-9df5-3ce1ed9b3fe2","year":2023},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:18.203435Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:ccadc59127c0798c5a8f90e20a0e75a307bd7ebe1bb3c24fd06f71e38f0583eb","observation_id":"6e930162-5b9e-46fd-bbd3-55ae43317b2f","resolution":{"observed_at":"2026-08-07T12:54:25.313406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:24.989871Z","title":"SUSiNet: See, understand and summarize it,","venue":null,"work_id":"a181ea15-1087-4797-938f-f31ec70c4c1c","year":2019},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:18.296863Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:bbf508b0e57d07e776c705e661daf8d0c4ac8e10ab02972f40f2b2703cb0785f","observation_id":"37a123c6-8d8f-45e2-9e3d-cf28bb2b2ff3","resolution":{"observed_at":"2026-08-07T12:54:25.093946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:24.758881Z","title":"UMT: Un iﬁed multi-modal transformers for joint video moment retrieval and highlight detection,","venue":null,"work_id":"3e968a2e-b5cd-4e13-9322-441c132d8fa5","year":2022},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:18.391846Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:a465a06dd672815a38916a4b3acacb4425f965101c0faf5b0ddeb0a0c08119d4","observation_id":"b95352db-86b7-431a-b4c9-d784454a8592","resolution":{"observed_at":"2026-08-07T12:54:24.873048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:24.484741Z","title":"CLIP-it! la nguage-guided video summarization,","venue":null,"work_id":"babce811-7f1e-4857-ad51-5072e0b7f4b0","year":2021},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:18.485127Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:a6ec1505800cc661c93adb30e37e12b0eb1fe747a2878b087ea37485dccd5bc8","observation_id":"b18d4533-263d-4070-8ab2-c6c5b36c6e65","resolution":{"observed_at":"2026-08-07T12:54:24.575792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:24.254903Z","title":"Creating summaries from user videos,","venue":null,"work_id":"ed9da5b7-93cb-45cf-98f4-6f963ed6586c","year":2014},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:18.562836Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:0fd1d307c826588941940ea5e12b38a448f78d2b8f29cd08dddaa398512b0cc8","observation_id":"eed8a926-2057-4442-8544-0f509613b852","resolution":{"observed_at":"2026-08-07T12:54:24.373861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:24.033518Z","title":"TVSum: Summarizing web videos using titles,","venue":null,"work_id":"0b48a265-3ae2-4353-964e-cfc650512fc0","year":2015},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:18.624966Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:64d6679fd27270298ecab70e85f11d52d7d1189941d192570478e60350a1fe53","observation_id":"45204a32-4423-49fc-9ad1-098b3bba9675","resolution":{"observed_at":"2026-08-07T12:54:24.135808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:23.846372Z","title":"Deep reinforcement learning for uns upervised video summarization with diversity-representativeness reward,","venue":null,"work_id":"aff97c7c-dc78-4d96-a70b-5b16f19a2751","year":2017},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:18.696700Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:882a90e8874cb1a666a342f575e3200827a630b591a7388ab3f1afc5eb9824b2","observation_id":"e7d54eac-11c2-4a59-a3f9-22799e0ee230","resolution":{"observed_at":"2026-08-07T12:54:23.948873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:23.604387Z","title":"Summarizing videos using concentrated attention and considering the un iqueness and diversity of the video frames,","venue":null,"work_id":"4c17a012-33b9-4139-bcd8-ab647cee2e2e","year":2022},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:18.750814Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:ec9d940cf8574a8cc12ec3f71edba92247200f7f4edd0776923e3d699db8fbe4","observation_id":"b50f2ff4-c28b-4b04-9487-0885bc7b84bd","resolution":{"observed_at":"2026-08-07T12:54:23.704468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:23.386382Z","title":"TL;DW? Summarizing Instructio nal Videos with Task Relevance and Cross-Modal Saliency,","venue":null,"work_id":"8488f6ae-40ca-4873-a0db-3192f578329d","year":2022},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:18.814953Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:884d85496bcaeba40afb75c2605e9108e12846e766e727dea17658c9dfad9feb","observation_id":"e77ff443-b4d3-477e-aa60-56085cc752ce","resolution":{"observed_at":"2026-08-07T12:54:23.487700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:23.179874Z","title":"Rethinkin g spatiotem- poral feature learning: Speed-accuracy trade-offs in vide o classiﬁcation,","venue":null,"work_id":"319312d7-457d-4f05-9c02-be3cb94be16d","year":2018},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:18.880999Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:51116fd5b742975074f4654bce63949f7ed055261946829c2699d98b715952ef","observation_id":"55f3bec8-60de-408a-881d-0d810d202a93","resolution":{"observed_at":"2026-08-07T12:54:23.276417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T12:54:18.964559Z","title":"RoBERTa: A robustly optim ized BERT pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:18.964559Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:008e3e2e1099ad29c6dbd38606062013281e78f8f8f4881c559dc191876542bb","observation_id":"9d8e2308-f7ff-452b-bd09-0dece83de2df","resolution":{"observed_at":"2026-08-07T12:54:18.964559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:23.043800Z","title":"AREDSUM: Adaptive redundancy-aware iterative sentence ranking for extracti ve document summarization,","venue":null,"work_id":"72008852-1274-4ae8-ae54-f0182421bef2","year":2020},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.039626Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:f1dbeb84456d37a563ccd0f19c2ead4eca9de4bef06e013be6fc2082862f280f","observation_id":"8f372dae-3bed-4e7b-80a0-5702f1a0bce0","resolution":{"observed_at":"2026-08-07T12:54:23.095873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:22.778093Z","title":"Attention is all you need,","venue":null,"work_id":"9453a343-721d-451e-a5ce-2ab65e2eff3f","year":2017},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.086216Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:72e44f940504535463be160a68ae70c3964437ea96494fa1d67d6bb37f56f4f3","observation_id":"cff0ff2b-9299-4c67-88a8-4af7ca625b7f","resolution":{"observed_at":"2026-08-07T12:54:22.903832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02358","last_updated":"2022-05-27T15:44:26Z","snapshot_observed_at":"2026-07-06T12:05:07.980255Z","submitted_at":"2021-11-03T17:20:36Z","title":"VLMo: Unified Vision-Language Pre-Training with Mixture-of-Modality-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02358","snapshot_observed_at":"2026-08-07T12:54:19.140326Z","title":"VLMo: Uniﬁed vision-language pre-train ing with mixture-of-modality-experts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.140326Z"},"links":{"cited_paper":"/paper/2111.02358","citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:7aa43afd5c2ada4c247b0e7d15c16d9d0f332481d2037f5c50ef651d0205d0f6","observation_id":"701e8788-8a6e-4869-bdc3-bb00788978c6","resolution":{"observed_at":"2026-08-07T12:54:19.140326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:22.524882Z","title":"Simple statistical gradient-followi ng algorithms for connectionist reinforcement learning,","venue":null,"work_id":"416d6534-fa72-4dc6-a825-b6ccc842e252","year":1992},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.191277Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:470994e94e92c3189bdcaa2ba3a9f53c9c65f366f6235c05b6d2dece36a2a2e1","observation_id":"5254dac2-47db-4fad-a325-79a852aafcc6","resolution":{"observed_at":"2026-08-07T12:54:22.639669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:19.241770Z","title":"Adam: A method for stochastic opt imization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.241770Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:263d877bfc1f60e8f142565adffa1486aa5f55fe77c2a010b423fe654f8f8b8c","observation_id":"a98664f6-bc7e-442c-ae1b-07415d1cbf90","resolution":{"observed_at":"2026-08-07T12:54:19.241770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:22.320395Z","title":"Abstractive text summarization using sequence-to-seque nce RNNs and beyond,","venue":null,"work_id":"6da59f75-9356-4a94-a170-e60d1f98c400","year":2016},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.289591Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:795d15e245d692e60182f60157f0e1f351296d20aeb264dc7dd7aaa17419ba64","observation_id":"58d02cb6-099b-4849-8583-bff9ff7666aa","resolution":{"observed_at":"2026-08-07T12:54:22.405014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:22.108397Z","title":"HowTo100M: Learning a text-video embedding by watching hu ndred million narrated video clips,","venue":null,"work_id":"388f4a9b-01bd-4557-b93b-9c475c823647","year":2019},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.335478Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:f00edb4700bce0860626fb9b1aabfb762021cd9f25cea5ac15b93bb0d8deecfd","observation_id":"61934291-2a83-4dc6-9eb2-afc055363ec3","resolution":{"observed_at":"2026-08-07T12:54:22.235780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:21.942364Z","title":"Mr. HiSum: A large-scale data set for video highlight detection and summarization,","venue":null,"work_id":"b6bc2f52-853c-4585-a02e-a2a74004d92f","year":2024},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.400921Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:8adc1e3d4b4246b5160b05a975b453b23df9f174a708a4b1aae3d59504b8cca8","observation_id":"a23ffb87-3931-4893-8939-5b73da35ad07","resolution":{"observed_at":"2026-08-07T12:54:22.019824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:21.761716Z","title":"Reth inking the evaluation of video summaries,","venue":null,"work_id":"9b6f0b82-ec4f-40f9-afa7-e269ec2efd2f","year":2019},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.459604Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:7b03fca714e63a1ae4cdc6055f16e26965e7a8d80ebfb77a2fae4d677d203d8f","observation_id":"75c4784f-b26e-4d75-83ae-6f872e9962c4","resolution":{"observed_at":"2026-08-07T12:54:21.831846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:21.403611Z","title":"Zwillinger and S","venue":null,"work_id":"1df7f60c-84a9-43f9-9257-370dad18f07c","year":1999},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.537886Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:ba05fd5b834ee8bc580211c840cf81b25455054666a7e65143d740143c538c93","observation_id":"72018b24-f092-453f-bdfc-639cb90eaf01","resolution":{"observed_at":"2026-08-07T12:54:21.598933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:21.043488Z","title":"The treatment of ties in ranking problem s,","venue":null,"work_id":"befa6679-8333-4dc5-9bc1-cfd2b50b44bb","year":1945},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.632314Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:c8404b063426d1938c3e2c04df39795a9f6f77e6fb85887841111c0f6a7c412d","observation_id":"e035518a-dc10-473d-bac5-0deeccae4290","resolution":{"observed_at":"2026-08-07T12:54:21.180234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:20.712614Z","title":"Cate gory-speciﬁc video summarization,","venue":null,"work_id":"67f8afb1-c2ca-4a38-a77f-97cd8c6fec7d","year":2014},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.724624Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:917a1dcdaf0f754554c1e3dba7dc6b4bdfdf3e1fa08f8c6c8a82ab1236aea4bc","observation_id":"245fb392-2849-4c05-a7e9-de4e43be91e6","resolution":{"observed_at":"2026-08-07T12:54:20.866198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.09305","last_updated":"2018-10-18T05:29:41Z","snapshot_observed_at":"2026-07-06T07:09:48.493785Z","submitted_at":"2018-10-18T05:29:41Z","title":"WikiHow: A Large Scale Text Summarization Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.09305","snapshot_observed_at":"2026-08-07T12:54:19.775314Z","title":"WikiHow: A large scale text su mma- rization dataset,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.775314Z"},"links":{"cited_paper":"/paper/1810.09305","citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:440067b197f089801a40706f074ab59d7e8643be93fd02afb379d55d939583e6","observation_id":"eb81ee09-0ff3-4f1d-b697-77588af1849d","resolution":{"observed_at":"2026-08-07T12:54:19.775314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:20.025098Z","title":"COG N- IMUSE: a multimodal video database annotated with saliency , events, semantics and emotion with application to summarization,","venue":null,"work_id":"b98f1ca6-c9fd-4c22-b532-4125c6b38d07","year":2017},"citing_paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:19.856159Z"},"links":{"citing_paper":"/paper/2505.23268"},"observation_digest":"sha256:be4b05c5c43732d15b9af1773baa74fab263ffc33662447491739e5713499a1f","observation_id":"1b59550b-3d56-4209-82fb-6d6801571aac","resolution":{"observed_at":"2026-08-07T12:54:20.479050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23268","last_updated":"2025-05-29T09:16:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:50:44.898413Z","submitted_at":"2025-05-29T09:16:19Z","title":"Unsupervised Transcript-assisted Video Summarization and Highlight Detection"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2505.23268."}