{"as_of":"2026-08-08T08:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b516ea59539d6192d5cec14e2d4d931882dbba1aee41f223fe51227792bc37db","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:29:20.024809Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18880/citation-record","integrity":"/paper/2505.18880/integrity","json":"/paper/2505.18880/citation-record.json","paper":"/paper/2505.18880"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.15000","last_updated":"2024-06-21T09:26:55Z","snapshot_observed_at":"2026-07-06T18:34:47.155846Z","submitted_at":"2024-06-21T09:26:55Z","title":"Unveiling the Impact of Multi-Modal Interactions on User Engagement: A Comprehensive Evaluation in AI-driven Conversations","version":1},"cited_work":{"arxiv_id":"2406.15000","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.15000","snapshot_observed_at":"2026-08-07T14:29:21.446393Z","title":"Unveiling the Impact of Multi-Modal Interactions on User Engagement: A Comprehensive Evaluation in AI-driven Conversations","venue":"cs.CL","work_id":"67f3adea-a151-4a81-9a42-c421b8fa5830","year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:13.821285Z"},"links":{"cited_paper":"/paper/2406.15000","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:297b73c803cbe9fc34d97a183c6f4cfc77d64e01e49c873496f6c988e296ab41","observation_id":"e283872b-5db8-4bad-941b-ec7e50502c26","resolution":{"observed_at":"2026-08-07T14:29:21.503164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:26.578778Z","title":"Eye tracking research on readers’ interactions with multimodal texts: a mini-review,","venue":null,"work_id":"55baefaf-ca81-4971-b93b-af13be153d04","year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:13.916042Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:23dfd2d84e01e9d2347c34358a6f33c980a94d0d0397ab85b580b4febcdb6076","observation_id":"0ad4a6d7-0ff3-401e-96a4-6481f86c5cd2","resolution":{"observed_at":"2026-08-07T14:29:26.679052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08670","last_updated":"2024-02-13T18:51:18Z","snapshot_observed_at":"2026-07-06T17:29:39.117068Z","submitted_at":"2024-02-13T18:51:18Z","title":"Rec-GPT4V: Multimodal Recommendation with Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08670","snapshot_observed_at":"2026-08-07T14:29:14.045791Z","title":"Rec-gpt4v: Multimodal recommendation with large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.045791Z"},"links":{"cited_paper":"/paper/2402.08670","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:a9d94e90447386050bbf1f6c583a8419e7f93448f54701f3b578e585756f03cf","observation_id":"0433936a-d9d1-4d8a-a280-72766676c584","resolution":{"observed_at":"2026-08-07T14:29:14.045791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07284","last_updated":"2023-06-12T18:13:44Z","snapshot_observed_at":"2026-08-03T08:42:55.898240Z","submitted_at":"2023-03-13T17:01:42Z","title":"Align and Attend: Multimodal Summarization with Dual Contrastive Losses","version":3},"cited_work":{"arxiv_id":"2303.07284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.07284","snapshot_observed_at":"2026-08-07T14:29:21.205679Z","title":"Align and Attend: Multimodal Summarization with Dual Contrastive Losses","venue":"cs.CV","work_id":"da8d9039-e3b2-4821-a747-9b476c426f9c","year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.172804Z"},"links":{"cited_paper":"/paper/2303.07284","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:55cb94268627baa71c74e6ab8b52ecf473571cf8ae41f6c931b58d11fd6776f8","observation_id":"1db1b61d-28ea-4596-85e3-07d8a510e747","resolution":{"observed_at":"2026-08-07T14:29:21.304387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:26.323127Z","title":"Plots to previews: Towards automatic movie preview retrieval using publicly available meta-data,","venue":null,"work_id":"3ec40f08-777a-4a70-af98-ecc571bc75c4","year":2021},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.351016Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:65195bb440b870f136513a7e2179b9a48615e310407b2737191df1e81862323a","observation_id":"00ce0d9d-983b-4e37-a3ca-52c7d07980f0","resolution":{"observed_at":"2026-08-07T14:29:26.438855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:26.115225Z","title":"Smart trailer: Automatic generation of movie trailer using only subtitles,","venue":null,"work_id":"6aeaaaca-79a3-450f-8ad0-491d3a1f7ebd","year":2018},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.531827Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:1543506297eb77e1c17844a8e65104be7482581207bc7affb72ffee51d08dfce","observation_id":"13544045-6944-48bc-9405-b1a1e51e3b48","resolution":{"observed_at":"2026-08-07T14:29:26.222279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:25.812534Z","title":"Automated production of tv program trailer using electronic program guide,","venue":null,"work_id":"be0ade67-5739-4144-9289-5d4b53316772","year":2007},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.693565Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:2d64e1d42d40e6f8464b3c221b5d539cebcdc86e791438520edd345efa2b3d6b","observation_id":"eed9ce76-bd70-4e33-9c35-c2fa8e4ffea9","resolution":{"observed_at":"2026-08-07T14:29:25.949360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:25.558454Z","title":"User preferences for automated curation of snackable content,","venue":null,"work_id":"1a2662f0-3d33-439a-819a-151f84398d35","year":2021},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.865046Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:47f52c06329e4eca00b7c386b9ac34e44b48e8d8b224bed8adcfcc8fd715e0af","observation_id":"197d26a8-09e8-4f18-b029-2e3352eb8a73","resolution":{"observed_at":"2026-08-07T14:29:25.704482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:25.226372Z","title":"Semi-supervised learning towards computerized generation of movie trailers,","venue":null,"work_id":"8c1f09b4-a4a9-4400-9e07-0307eb9c4561","year":2015},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.987099Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:f982a980e8006822968d4588b07d4ed7903f890c258d7f712cdfc39f68a0439d","observation_id":"b9a03670-b177-4baf-b368-8fedc86c964c","resolution":{"observed_at":"2026-08-07T14:29:25.364440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:24.834667Z","title":"Harnessing ai for augmenting creativity: Application to movie trailer creation,","venue":null,"work_id":"4aa74f7d-0ab3-4772-9c51-6f95a5c64690","year":2017},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.178708Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:89bd60e0a6044a8e26163d146c541d5b75837bfa0c1a402a40b0307efabda3e9","observation_id":"4b8c28ea-9b35-487b-85a2-d777b4236464","resolution":{"observed_at":"2026-08-07T14:29:25.029017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05586","last_updated":"2024-11-10T02:20:47Z","snapshot_observed_at":"2026-08-06T09:11:18.171594Z","submitted_at":"2024-10-08T01:00:09Z","title":"TeaserGen: Generating Teasers for Long Documentaries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05586","snapshot_observed_at":"2026-08-07T14:29:15.410134Z","title":"Teasergen: Generating teasers for long documentaries,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.410134Z"},"links":{"cited_paper":"/paper/2410.05586","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:ece2401975648c5d4a62cbc34d631b55535f374b5091028070ef0f0ac9dac15e","observation_id":"aca99c3f-e2a1-49bc-af14-dc0ae6b84918","resolution":{"observed_at":"2026-08-07T14:29:15.410134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05298","last_updated":"2025-04-07T17:56:31Z","snapshot_observed_at":"2026-08-07T16:07:51.376018Z","submitted_at":"2025-04-07T17:56:31Z","title":"One-Minute Video Generation with Test-Time Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05298","snapshot_observed_at":"2026-08-07T14:29:15.602226Z","title":"One-minute video generation with test-time training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.602226Z"},"links":{"cited_paper":"/paper/2504.05298","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:1851eeffaeda2c978174d93ba87d56cdf60b15bfef300c2bac74dbf46b500b89","observation_id":"fe89d4ab-7b8b-4ef2-85f4-91b98e647d97","resolution":{"observed_at":"2026-08-07T14:29:15.602226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:15.802195Z","title":"Survey of hallucination in natural language generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.802195Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:a139f60f048416eb87d921f99f78b6e97455ab691189a3f7c0ae076e1e53454e","observation_id":"e553459f-b397-4015-b369-eef08cd93f86","resolution":{"observed_at":"2026-08-07T14:29:15.802195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-07T14:29:15.936001Z","title":"Hallucination of multimodal large language models: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.936001Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:772fd63c15572eacb46174073c8414562cacf4229b9e468036faf821fb695fa7","observation_id":"29897abb-c2d5-43f6-8d74-e31bb57dbd17","resolution":{"observed_at":"2026-08-07T14:29:15.936001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-08-07T14:29:16.063811Z","title":"Hallucination is inevitable: An innate limitation of large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.063811Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:c81ecd3a658cf8a37df20992a811af81fd6d2479fb6415f6a6a428d967f52e74","observation_id":"5e603a2a-4222-4987-b25f-7b9a4cfa8408","resolution":{"observed_at":"2026-08-07T14:29:16.063811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00747","last_updated":"2023-07-11T17:07:19Z","snapshot_observed_at":"2026-08-07T11:26:26.674534Z","submitted_at":"2023-03-01T18:59:13Z","title":"WhisperX: Time-Accurate Speech Transcription of Long-Form Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00747","snapshot_observed_at":"2026-08-07T14:29:16.220352Z","title":"Whisperx: Time-accurate speech transcription of long-form audio,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.220352Z"},"links":{"cited_paper":"/paper/2303.00747","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:3f9946b51941fadbf54817d66b5556d61138b428cb56698544060249ecc3ded5","observation_id":"1327115d-b2b1-4216-9fde-40745f918d60","resolution":{"observed_at":"2026-08-07T14:29:16.220352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08037","last_updated":"2023-02-10T20:04:05Z","snapshot_observed_at":"2026-07-06T14:31:07.280398Z","submitted_at":"2022-12-15T18:45:29Z","title":"Attributed Question Answering: Evaluation and Modeling for Attributed Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08037","snapshot_observed_at":"2026-08-07T14:29:16.346157Z","title":"Attributed question answering: Evaluation and modeling for attributed large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.346157Z"},"links":{"cited_paper":"/paper/2212.08037","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:129cb2ba3365b3794e839d665c68287dd8fa355a0baa5615cd9c7b90d19aa04e","observation_id":"6e73a2d4-e2f9-4bc2-9450-016286e49751","resolution":{"observed_at":"2026-08-07T14:29:16.346157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:24.461190Z","title":"Learning fine-grained grounded citations for attributed large language models,","venue":null,"work_id":"6d6a7004-338b-4c8c-b8b7-2ade32adc44d","year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.506154Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:80dc4569a4430b61fc4758362482c327fbc890736ba07efd8e8a7625ff38e855","observation_id":"5b05f4e7-53e9-411b-b496-e02bacec2437","resolution":{"observed_at":"2026-08-07T14:29:24.643144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:24.128899Z","title":"Dense passage retrieval for open-domain question answering,","venue":null,"work_id":"cc26082c-d221-444a-987f-9d690395a164","year":2020},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.633785Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:4eb4f4411ee8338745ac22eeab1175feb3ad1ef07dee79e0eecab8fdd21dd125","observation_id":"a993bad8-35ba-41a8-be34-26186ba1df4d","resolution":{"observed_at":"2026-08-07T14:29:24.306266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:23.834092Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks,","venue":null,"work_id":"e5abbaf6-74ce-4261-9cd5-2739f68e4ac0","year":2020},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.718104Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:80663b4af0affcf16b1aa4cace2753d14391d333f0db38439ab3b3ef6322285a","observation_id":"d28dce8e-ab53-42e9-9971-22ecf4a5c47b","resolution":{"observed_at":"2026-08-07T14:29:23.966223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05876","last_updated":"2024-10-23T14:48:20Z","snapshot_observed_at":"2026-08-05T14:42:13.473991Z","submitted_at":"2023-11-10T05:24:04Z","title":"Trends in Integration of Knowledge and Large Language Models: A Survey and Taxonomy of Methods, Benchmarks, and Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05876","snapshot_observed_at":"2026-08-07T14:29:16.912491Z","title":"Trends in integration of knowledge and large language models: A survey and taxonomy of methods, benchmarks, and applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.912491Z"},"links":{"cited_paper":"/paper/2311.05876","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:f9dae014b166cd700e9f74f69712fcd945d93669f24958596da64a4408cf9715","observation_id":"0b85dbfe-06a0-4221-a98a-74327f2cff90","resolution":{"observed_at":"2026-08-07T14:29:16.912491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-07T14:29:17.043717Z","title":"Lamda: Language models for dialog applications,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.043717Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:9f87ff948dada82b1fa7ab4a85ca6773546d8ad76d83216ae8bbae1bf03eccaa","observation_id":"8261d55b-cc8e-4d76-b4cf-386f27004647","resolution":{"observed_at":"2026-08-07T14:29:17.043717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:23.452845Z","title":"Evaluating verifiability in generative search engines,","venue":null,"work_id":"e09ac7d0-42b0-4cef-8fbb-de43e6f6f9ac","year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.243963Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:c3bd68d0e1442b443436f40f03758763f33100ccca60bffcabeed2714d9fc92a","observation_id":"d94cd4b9-6c70-47ac-8b0d-943d15a76c7a","resolution":{"observed_at":"2026-08-07T14:29:23.618273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:23.166469Z","title":"Clip-it! language-guided video summarization,","venue":null,"work_id":"4833623d-033d-490d-9d0f-ca670130b847","year":2021},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.345158Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:84aa1b2ee3701eb28fbae7b2b346e3d3767aa733b1bc42b938deb915006c20af","observation_id":"6cbb0576-5b99-4f9c-bec4-1132ffa6d156","resolution":{"observed_at":"2026-08-07T14:29:23.296737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03398","last_updated":"2024-04-04T11:59:06Z","snapshot_observed_at":"2026-07-06T17:55:36.748672Z","submitted_at":"2024-04-04T11:59:06Z","title":"Scaling Up Video Summarization Pretraining with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03398","snapshot_observed_at":"2026-08-07T14:29:17.536205Z","title":"Scaling up video summarization pretraining with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.536205Z"},"links":{"cited_paper":"/paper/2404.03398","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:4838bec73992e7107f130ce0c5150afbd65cb6dd5daccba995dbe05c9d8cd6f3","observation_id":"755f5b7f-afd3-40d4-8d6d-1b04e322d7a3","resolution":{"observed_at":"2026-08-07T14:29:17.536205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03477","last_updated":"2024-04-04T14:28:34Z","snapshot_observed_at":"2026-08-04T10:54:34.276165Z","submitted_at":"2024-04-04T14:28:34Z","title":"Towards Automated Movie Trailer Generation","version":1},"cited_work":{"arxiv_id":"2404.03477","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.03477","snapshot_observed_at":"2026-08-07T14:29:20.825213Z","title":"Towards Automated Movie Trailer Generation","venue":"cs.CV","work_id":"8df4a004-f40a-4eae-9698-360c1e057cc1","year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.663260Z"},"links":{"cited_paper":"/paper/2404.03477","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:45d53867caa008dbd99f1e00d1c9758d21aa218e2ac05ca8841f849e77663741","observation_id":"794680f7-d888-4de9-9749-587bbb685941","resolution":{"observed_at":"2026-08-07T14:29:20.939408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:22.896386Z","title":"\"previously on","venue":null,"work_id":"1d1284ad-9942-4743-9167-be9640b781e7","year":null},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.787983Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:6d09d89088bd9839b910637ec7a24d320a8ba823ddac9d16aa14525c0dc794c0","observation_id":"995a39ee-b9a4-46ae-b5a6-42bfa0740cc9","resolution":{"observed_at":"2026-08-07T14:29:23.046760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:22.573692Z","title":"Videoxum: Cross-modal visual and textural summarization of videos,","venue":null,"work_id":"27b7b235-8641-4e85-af94-68b157589a38","year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.143672Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:5cd2d54aa76e96774f1bb7fda6e1e081ea3d84bf4f5061789c860f3c24cc1265","observation_id":"b5b07bb0-2b4b-428a-bf4c-084710c66a73","resolution":{"observed_at":"2026-08-07T14:29:22.767143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:29:18.310362Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.310362Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:9f8834d92ca87bee42b2e24c94f4115c0e0d2abb36a537710551685aa527400e","observation_id":"8f9a7602-70c7-4fb0-a5ed-075663663f95","resolution":{"observed_at":"2026-08-07T14:29:18.310362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:29:18.464070Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.464070Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:e0c320d82d3dd9912df9633b6528eda759c536ef5e54174c6c81dd28afebee47","observation_id":"611a5f88-a102-4d55-b1a4-5aa99f99c993","resolution":{"observed_at":"2026-08-07T14:29:18.464070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:22.319312Z","title":"Univtg: Towards unified video-language temporal grounding,","venue":null,"work_id":"beada131-8bbf-46b0-8dd9-a5884b47fd70","year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.600886Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:e2764275336e21f6a89ea9c2521bc00533c3df1f2f08fa5884959b53b1ad2307","observation_id":"15dfc0bf-8ef2-4f11-b1c5-172cd213cab2","resolution":{"observed_at":"2026-08-07T14:29:22.428707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:22.230077Z","title":"BART: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension,","venue":null,"work_id":"1226cccb-b4c7-4050-96a0-9d054ce02df0","year":2020},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.746817Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:05b1f08f464ca23bfb31c1a65ff38dbec30b09771ef1af972b4e3d5bea4272f1","observation_id":"b9fd862c-5ee2-4632-8fa3-04215822810b","resolution":{"observed_at":"2026-08-07T14:29:22.276219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:22.064766Z","title":"Sentence-Transformers/all-mpnet-base-v2,","venue":null,"work_id":"b38d4da2-f860-4396-a325-92be257a60b2","year":2022},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.921410Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:1d4b1764b0a91a8963c43defce38c3cc908519e6f27dc7a39a8af8e30a05ca08","observation_id":"a8ac58e6-26a8-49dd-8ca4-04d4c6d8141b","resolution":{"observed_at":"2026-08-07T14:29:22.152397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:19.091604Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.091604Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:3c73ae3f239a7afe8c18983273605b5d237186623ca0b92962cf53778dc23422","observation_id":"33152d2e-3f97-487e-8a01-c14956feedc9","resolution":{"observed_at":"2026-08-07T14:29:19.091604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-07T14:29:19.209163Z","title":"G-eval: Nlg evaluation using gpt-4 with better human alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.209163Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:e1e747f502fde30e0785ad0c7f7a2433748743dc7c31c6062b0dfa91910846ed","observation_id":"5825d89c-5d59-42d6-8a1b-3f7c73a2da59","resolution":{"observed_at":"2026-08-07T14:29:19.209163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:21.832709Z","title":"DeepEval: The open-source llm evaluation framework,","venue":null,"work_id":"150338fe-433c-4e85-8999-8f2757c3f87f","year":2025},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.386401Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:0a489d57f1c94ca7156b15dd0970d904367e916a08e54977be4ab6b323c1874a","observation_id":"1a23693b-7bbf-4a73-bb6a-a94c48240283","resolution":{"observed_at":"2026-08-07T14:29:21.909800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T14:29:19.582613Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.582613Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:2e38a532d8a562eb05b5a8f3797ff850aee5436e331b5350f815d67f32785d2a","observation_id":"6c7bcdc1-29a1-4a3e-a923-eb52436eb22f","resolution":{"observed_at":"2026-08-07T14:29:19.582613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:21.607036Z","title":"Screenwriter: Automatic screenplay generation and movie summarisation,","venue":null,"work_id":"c6916d0e-d49b-4fbb-9147-b28ec683367d","year":null},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.738415Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:eda091fe5b158a456406331b84c4cbc33ce2013e4ad3a52aa7ffa1ff04057342","observation_id":"157f6fda-85e1-463a-a81e-8843022d8fda","resolution":{"observed_at":"2026-08-07T14:29:21.731470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08080","last_updated":"2022-08-17T05:30:18Z","snapshot_observed_at":"2026-07-06T13:42:36.328169Z","submitted_at":"2022-08-17T05:30:18Z","title":"Multimodal Lecture Presentations Dataset: Understanding Multimodality in Educational Slides","version":1},"cited_work":{"arxiv_id":"2208.08080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.08080","snapshot_observed_at":"2026-08-07T14:29:20.203821Z","title":"Multimodal Lecture Presentations Dataset: Understanding Multimodality in Educational Slides","venue":"cs.AI","work_id":"3675c490-1bf4-4cf6-b116-3a885b5e32f8","year":2022},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:20.024809Z"},"links":{"cited_paper":"/paper/2208.08080","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:d8bf28d351a12bd79bd462074c027c807affb5c3fc34a5d0fddd4dde3b818366","observation_id":"774a4142-778a-4689-83df-0ffee8a6b303","resolution":{"observed_at":"2026-08-07T14:29:20.283989Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19809","last_updated":"2024-10-17T07:59:54Z","snapshot_observed_at":"2026-08-03T05:31:05.504399Z","submitted_at":"2024-10-17T07:59:54Z","title":"ScreenWriter: Automatic Screenplay Generation and Movie Summarisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19809","snapshot_observed_at":"2026-08-07T14:29:19.875241Z","title":"Available: https://arxiv.org/abs/2410.19809","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.875241Z"},"links":{"cited_paper":"/paper/2410.19809","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:89832164a4c5cf72ca32a089a014308d0cdcdd5267801d1869ddb85b5da670e2","observation_id":"7b99f98a-f4e5-4dfd-9b63-c8b86f0a807a","resolution":{"observed_at":"2026-08-07T14:29:19.875241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11487","last_updated":"2024-05-19T09:09:54Z","snapshot_observed_at":"2026-07-06T18:16:20.122022Z","submitted_at":"2024-05-19T09:09:54Z","title":"\"Previously on ...\" From Recaps to Story Summarization","version":1},"cited_work":{"arxiv_id":"2405.11487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.11487","snapshot_observed_at":"2026-08-07T14:29:20.557390Z","title":"\"Previously on ...\" From Recaps to Story Summarization","venue":"cs.CV","work_id":"e035a66c-fdd9-488d-8d40-86336484e826","year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.974793Z"},"links":{"cited_paper":"/paper/2405.11487","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:c299cb81996cc528782cbcc77098b00eb516a13efb6a8a52648592fb97177644","observation_id":"2576b8f1-a8db-442e-b5c9-50ee6f3a5698","resolution":{"observed_at":"2026-08-07T14:29:20.705164Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":19},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2505.18880."}