{"as_of":"2026-08-09T01:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e625e703fa9d114023df02047734c3b6429fb43dcc83d2da36d51490d8690e54","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:38:45.547295Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23714/citation-record","integrity":"/paper/2506.23714/integrity","json":"/paper/2506.23714/citation-record.json","paper":"/paper/2506.23714"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:51.762835Z","title":"Apostolidis, E","venue":null,"work_id":"8a16a04f-4b27-4d7b-b227-5de8894ea1d1","year":2021},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:41.726899Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:d386e36f6655fce8416c93d3159c9a5f526b992eaa48aed253816c80b2b158ee","observation_id":"1c8d0ab6-eabf-45ec-ba85-c2c154aa2a93","resolution":{"observed_at":"2026-08-06T21:38:51.946959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:51.568443Z","title":null,"venue":null,"work_id":"8f264246-9243-4d3d-a50d-32a3f751f5e6","year":2015},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:41.843334Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:aafe5baba6366cda2c83a68f3499027b72a5ca30d6464d2f7b7cdf57fceaf20d","observation_id":"2eb97bf5-b907-4c40-9252-8890bcc32079","resolution":{"observed_at":"2026-08-06T21:38:51.675229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:51.379651Z","title":"Tiwari, C","venue":null,"work_id":"c033170d-c157-4074-94a2-42f0e7b49dc3","year":2021},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:41.927525Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:7d95f13546989d07d9659ef7c1baf16ad7c06ad7a9c9cc1a6080af0a35c9df0a","observation_id":"a9d4485a-7722-4d00-85f7-da7d4868509a","resolution":{"observed_at":"2026-08-06T21:38:51.479100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:51.193806Z","title":"Otani, Y","venue":null,"work_id":"f2e2ed00-5a78-490a-85ba-57efd4a85882","year":2016},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.019442Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:f7cb62404efeb8d5bce1ef9f0abdad05499bc707e58c1a49e798b3fa2eba072f","observation_id":"381d26d5-de0e-4068-917a-b53ec001a0dc","resolution":{"observed_at":"2026-08-06T21:38:51.283393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:50.969756Z","title":"Rochan, L","venue":null,"work_id":"5c2d6fa2-7bbb-41b8-985a-150dc4c538c8","year":2018},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.083343Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:451c00afbc872bcb3b9776c614fa5a36e3c236302e2fd87f93718ef8846e591d","observation_id":"cbc56d9b-5ee8-48fc-8314-4b61e76cd7bd","resolution":{"observed_at":"2026-08-06T21:38:51.086223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:50.718228Z","title":null,"venue":null,"work_id":"9c23720a-694a-49a1-86bd-6cb2ee1e32eb","year":2024},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.160765Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:0477565199d383b45b4e00ae1dc795b1645f7898d846fabf01b7bba50ef612dd","observation_id":"961b9393-b0aa-4f4b-9f6b-1dc8cdf10302","resolution":{"observed_at":"2026-08-06T21:38:50.835567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:50.550229Z","title":null,"venue":null,"work_id":"7b3cac82-7c8b-4a70-aa08-37961fb7246c","year":1969},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.271990Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:2f5b9782787444e392bdd12caa622b7159f2b1438eb7c1be3abfe34121ad0db7","observation_id":"0c249360-1a60-4e4d-8517-c8cd63ef52e5","resolution":{"observed_at":"2026-08-06T21:38:50.613929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:42.386654Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.386654Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:fd1d33526a306b925ac0e975a3528838f7144e6ab0e0744a82ea4cf84d400890","observation_id":"f5e1c958-ed12-4208-b7d2-94f2b619d2b5","resolution":{"observed_at":"2026-08-06T21:38:42.386654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04368","last_updated":"2017-04-25T05:47:50Z","snapshot_observed_at":"2026-07-06T05:37:49.239583Z","submitted_at":"2017-04-14T07:55:19Z","title":"Get To The Point: Summarization with Pointer-Generator Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04368","snapshot_observed_at":"2026-08-06T21:38:42.501169Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.501169Z"},"links":{"cited_paper":"/paper/1704.04368","citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:51abd44b9e5ae2bd334809dca3cc6668f70cd1e0894c3eebb3c28ceca411169e","observation_id":"2c3d545d-d505-4b1e-9333-520bc826e5bb","resolution":{"observed_at":"2026-08-06T21:38:42.501169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:50.282137Z","title":null,"venue":null,"work_id":"432d1f16-33a9-4ea3-8658-877b955c33f2","year":2018},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.593261Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:669a1b3e83bb7890ef5a9eeb761b6dad5856d60e683a9a0c22e707e55913c984","observation_id":"0d9b036c-f9b5-483c-886a-d230ec05a78b","resolution":{"observed_at":"2026-08-06T21:38:50.445452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:50.107720Z","title":null,"venue":null,"work_id":"c36acdfe-07dd-4e13-beb1-56946166429e","year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.792890Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:e7913382b8da820ea18cac4a0d831aaccb9d5d81e2fda1bce28cb46cec541175","observation_id":"a207b5fe-3468-416a-982f-cee44c9e27ea","resolution":{"observed_at":"2026-08-06T21:38:50.194173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:49.903756Z","title":null,"venue":null,"work_id":"67856450-6f7e-4449-b1ee-5a7be18471ea","year":2021},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.831226Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:52aeff27ce10214d30e956f03308cbd578e8900550c9f57ec146f945b5977833","observation_id":"a72f83fe-2201-4393-bfcd-80fed780a55d","resolution":{"observed_at":"2026-08-06T21:38:50.036229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:49.650891Z","title":null,"venue":null,"work_id":"0e7222bc-4635-459c-9c52-774b648d34bb","year":2024},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.910882Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:b904be8b843bc3fb522fad43dfe59223ecfcdbe841a91efe12f2852b062af979","observation_id":"c798f581-c284-4204-adee-12e3d0c0733a","resolution":{"observed_at":"2026-08-06T21:38:49.782366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:49.407502Z","title":"Zhang, W.-L","venue":null,"work_id":"0bd4d80a-62ac-4467-8b3f-eb238a17c698","year":2016},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.006112Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:a191cb7cdc91652f364a1ee5fdc7f974e3f73d0c78e382f3787813377a645746","observation_id":"5a0af3e5-a26c-4430-9d5a-89f6a6ffd8f0","resolution":{"observed_at":"2026-08-06T21:38:49.528283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:49.165706Z","title":"Saini, K","venue":null,"work_id":"15e48646-9a2f-4a5b-a598-92c65f17fb52","year":2023},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.118186Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:618d083916d5eb52fc109a09b08039e38e24b588f5abd5886c423aefc854cf66","observation_id":"62b27317-ba1b-4d54-8481-cb8ebca2c983","resolution":{"observed_at":"2026-08-06T21:38:49.287084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:48.975185Z","title":"Evangelopoulos, A","venue":null,"work_id":"ead247cb-7a11-44fd-90d8-397a6eb17ae2","year":2013},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.213503Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:d06f863db8d519b516ca04c7c7993c33821d9cb03314fcd4285def86eb722e4b","observation_id":"886df382-a896-4c47-9f4c-2b180d455ba8","resolution":{"observed_at":"2026-08-06T21:38:49.078689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01814","last_updated":"2023-01-20T00:18:49Z","snapshot_observed_at":"2026-07-06T13:27:49.894090Z","submitted_at":"2022-07-05T05:14:15Z","title":"Multimodal Frame-Scoring Transformer for Video Summarization","version":3},"cited_work":{"arxiv_id":"2207.01814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.01814","snapshot_observed_at":"2026-08-06T21:38:45.877367Z","title":"Multimodal Frame-Scoring Transformer for Video Summarization","venue":"cs.LG","work_id":"89846e4e-851c-4086-83bb-6b239cd03eba","year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.276662Z"},"links":{"cited_paper":"/paper/2207.01814","citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:76c4aea5e92dd2b72f8e8eaddeb778db4576d4b8b5ca39d807cf3dc34a2ec593","observation_id":"fb2656d3-fa37-472f-b2af-f9f51d9aa4df","resolution":{"observed_at":"2026-08-06T21:38:45.965102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:48.718814Z","title":null,"venue":null,"work_id":"249151a9-fc72-4dc6-93a3-6abcf0bed3b7","year":2021},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.444350Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:f544b493f7308a09eda17054696ecd385707a06b028c723a98d66bd3edb2ed82","observation_id":"d39ed602-c3d9-42ff-bcc5-f0bda509258b","resolution":{"observed_at":"2026-08-06T21:38:48.856571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:48.455106Z","title":null,"venue":null,"work_id":"0a90c9e8-6cc3-4660-a988-58e1f1fd3b3a","year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.569978Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:f8b776c0f3bfd1cf86449bd0d5fa3bf2a0c4e698b45610ed63628a13544e9520","observation_id":"b1503f76-54af-49d9-b4d3-70b0802bf9d5","resolution":{"observed_at":"2026-08-06T21:38:48.607542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:48.242787Z","title":"Psallidas, P","venue":null,"work_id":"ac6d0b2b-091a-4f22-9e54-c5e70d3322d3","year":2021},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.730639Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:f3d4deaea14239d3d5848d392b1f27cb5391b7c77936b78894ff97b7e2a01138","observation_id":"a9f653a7-cd91-4f50-9d39-55e416539141","resolution":{"observed_at":"2026-08-06T21:38:48.323566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:48.123598Z","title":null,"venue":null,"work_id":"93e0ae5c-1a70-4e20-b23b-458ba846247a","year":2023},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.802627Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:de6ce6d19ffdffa25d7ca52772bc77a810e189c0c9be86a325505bae926bca41","observation_id":"cbc3dd90-8b34-4a14-ac97-60f9b3d3be1a","resolution":{"observed_at":"2026-08-06T21:38:48.174758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:47.985935Z","title":null,"venue":null,"work_id":"0e33f641-e6f5-4102-b8e2-ea6637325c48","year":2024},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.934293Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:358cd0541d6865b2b8606ebef8fe0d6e0a7ea87ff039eaeb3ffe8a4cb108123f","observation_id":"144dfa5c-f4b8-4c54-a3bf-1e44247daee2","resolution":{"observed_at":"2026-08-06T21:38:48.054461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:47.825739Z","title":null,"venue":null,"work_id":"01241bc2-189d-4b1e-876b-5927bb89f4c5","year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.117750Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:7da70c23d34299ca90f0398eeb555dc8b8ca13458f127f09d55b458b4473d7e8","observation_id":"8c7936bb-aefd-439f-97de-1c0c8bb55e04","resolution":{"observed_at":"2026-08-06T21:38:47.918043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:47.688196Z","title":"Ponce-López, B","venue":null,"work_id":"595e1cc2-7de9-4f85-bf67-556cae959dfb","year":2016},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.274131Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:5e25dfc0f1ea54b44bdd340b843246128b90e3d4bb82e66879e988bd2e0228a6","observation_id":"e6bc727e-9258-4621-9e86-eb581face9c4","resolution":{"observed_at":"2026-08-06T21:38:47.765723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T21:38:44.378445Z","title":"Radford, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.378445Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:da476e99771b8fdf029d70cabd16b1be3d2b9d47e0a9859ad92fefd92648577d","observation_id":"454caf69-4c5d-4748-8eef-257f5696f746","resolution":{"observed_at":"2026-08-06T21:38:44.378445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:47.555620Z","title":"Honnibal, I","venue":null,"work_id":"afd3cf67-d338-4199-85bc-8a15f3231d03","year":2020},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.467892Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:b1f654e57057e6cc1c80c5b2d9c2d205b581dbfa6f63fc00131f54da910303b2","observation_id":"40129d1c-c0d4-4d33-a40f-6d5796b06ee4","resolution":{"observed_at":"2026-08-06T21:38:47.609541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:47.327863Z","title":"McAuliffe, M","venue":null,"work_id":"d59cb080-ebe8-42ff-93cc-683695962308","year":2017},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.581457Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:2031e7312a38f206c437291697c155692a003fbef922ae6eb4899dfed0427252","observation_id":"15ad8d3d-7527-4caa-b676-3655989e9ea0","resolution":{"observed_at":"2026-08-06T21:38:47.442804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:47.123757Z","title":"Bradski, The opencv library., Dr","venue":null,"work_id":"6b6eb528-fe8e-468c-812b-9f96c90d062c","year":2000},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.656403Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:2cabea661eb7185a483ca49449d17db443a94f282bcbced7591255763f304554","observation_id":"2b019d12-fe56-4340-aa0d-f2d290cdfe2a","resolution":{"observed_at":"2026-08-06T21:38:47.182495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-05T19:15:35.517082Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-06T21:38:44.780495Z","title":"Lugaresi, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.780495Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:52ec2755dd1fe24acf7ba10e3e1bca2b7abfe32106196adc55fd3556463e1dfb","observation_id":"bdce2f8c-fb21-465d-a7e6-e7799bf975fc","resolution":{"observed_at":"2026-08-06T21:38:44.780495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:44.868440Z","title":"Serengil, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.868440Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:9873a9ccdbbf3929cc528320cae7473121798096e6a3cc1d8f6e1856cce8b1e2","observation_id":"5c5b0eb6-fc0a-4835-9f06-09b9bbe92be0","resolution":{"observed_at":"2026-08-06T21:38:44.868440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:46.866484Z","title":"Kasi, Yet another algorithm for pitch tracking (yaapt), 2002","venue":null,"work_id":"c1ce862b-cc60-4966-876b-c42b41f1d9c7","year":2002},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:45.019358Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:acd9b9474f281e817589ffc73f8dafba98702eda2ede5ef428d7d3b8dcbe33aa","observation_id":"5bc15467-43d0-45ed-b8e9-6b5c2583ff94","resolution":{"observed_at":"2026-08-06T21:38:46.996042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:46.673256Z","title":"Eyben, M","venue":null,"work_id":"c37bd1a6-811c-49c1-a261-47072dbe517b","year":2010},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:45.121470Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:22f1c4733fc4bdcd9e26859ae930ccba40d5a0b3a2b05aab84bfc8b936589953","observation_id":"65596910-48c2-42f9-aad3-7f074369f7c3","resolution":{"observed_at":"2026-08-06T21:38:46.771570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:46.494801Z","title":"Sparck Jones, A statistical interpretation of term specificity and its application in retrieval, Journal of documentation 28 (1972) 11–21","venue":null,"work_id":"a98a7123-1766-4635-895b-30f56648d2f4","year":1972},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:45.264167Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:ee5d5a3d748008a3580b6e4997fc56a21cc1d472826dc37edb1f1eadfb3eaee3","observation_id":"a4398015-e2c8-4dc7-b105-5bb6393f2704","resolution":{"observed_at":"2026-08-06T21:38:46.554911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:46.304900Z","title":null,"venue":null,"work_id":"7b5d5de4-2737-492e-8115-9a3dd70b47cb","year":2016},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:45.362663Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:9bf2da4d38d69d3641d842840f49fa62f96680c6d71386a20a0a57c43b7171a8","observation_id":"8296f4a2-12d4-42c6-89b9-ca931e52cdeb","resolution":{"observed_at":"2026-08-06T21:38:46.397336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03398","last_updated":"2024-04-04T11:59:06Z","snapshot_observed_at":"2026-07-06T17:55:36.748672Z","submitted_at":"2024-04-04T11:59:06Z","title":"Scaling Up Video Summarization Pretraining with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.03398","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.03398","snapshot_observed_at":"2026-08-06T21:38:45.665208Z","title":"Scaling Up Video Summarization Pretraining with Large Language Models","venue":"cs.CV","work_id":"3145fbb7-238c-4f4a-904d-c2cb2b8ad046","year":2024},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:45.460292Z"},"links":{"cited_paper":"/paper/2404.03398","citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:3e3807949b2a3ff17361d0e08ef211c245c7c36f1af5f7f0c586e357ab1f7bca","observation_id":"a69251c5-26de-4f6c-b9ca-fa59d31aa6b9","resolution":{"observed_at":"2026-08-06T21:38:45.783605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:46.151550Z","title":"Narasimhan, A","venue":null,"work_id":"0ed81853-d5a0-4781-a4b3-3b6ecd41befc","year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:45.547295Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:fe267f5df440ba6795cd1546c92327afc34b97e5d6bb165357e3ca2b82ee02dd","observation_id":"d4c6b550-d87d-4990-bc63-c22d7e5f54d0","resolution":{"observed_at":"2026-08-06T21:38:46.223123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":16},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2506.23714."}