{"as_of":"2026-08-07T06:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ad40fcfceb1a9bf20279407e76aa617ccd573bcdf87717c846aa3b51c30d7b4","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:17:58.243690Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T00:55:59.857014Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T00:57:54.247973Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"cited_work":{"arxiv_id":"2507.16873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16873","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hippo-video: Simulating watch histories with large language models for personalized video highlighting","venue":null,"work_id":"4dddbb22-4d9b-4bf7-9c37-d75eeeb7ef3d","year":2025},"citing_paper":{"arxiv_id":"2605.18653","last_updated":"2026-05-18T17:00:15Z","snapshot_observed_at":"2026-08-02T07:47:03.226350Z","submitted_at":"2026-05-18T17:00:15Z","title":"Will It Go Viral? Grounding Micro-Video Popularity Prediction on the Open Web","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T00:55:59.857014Z"},"links":{"cited_paper":"/paper/2507.16873","citing_paper":"/paper/2605.18653"},"observation_digest":"sha256:a39b76c6fdfb3dbd86c5b84cfc712f0578f64fa3b9ff66de65522201a4e6cb44","observation_id":"07909adf-c8b8-4550-8409-6fd6794033a1","resolution":{"observed_at":"2026-05-20T00:57:54.249989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.16873/citation-record","integrity":"/paper/2507.16873/integrity","json":"/paper/2507.16873/citation-record.json","paper":"/paper/2507.16873"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T15:17:57.694812Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.694812Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:d2f5058c8f61c35bdadf82058a84facfad578d31bdc83a84dda5867b692a2aaa","observation_id":"111e67ee-b96a-4a46-9964-b9ba7fe484d4","resolution":{"observed_at":"2026-08-06T15:17:57.694812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.546558Z","title":"Video summarization using deep neural networks: A survey","venue":null,"work_id":"bdd46c24-ba30-4713-8577-f60b3c08bcdc","year":2021},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.706308Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:42976c34731c326d14a6929c49c4cb2d411acfbf62f262f3ddc2442e748d677a","observation_id":"14b28a1e-c8e4-472a-b772-576670cb78ee","resolution":{"observed_at":"2026-08-06T15:18:00.559165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.517172Z","title":"Towards automated movie trailer generation","venue":null,"work_id":"8420803c-bdb4-4cba-9891-9af967e0e3b0","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.715747Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:b7c806fc7cf4170a9ec3d2eeb57b68cb31baef5935ef092ca5d7fce1f7f1624f","observation_id":"4f93a273-ade6-4024-b885-94c9a4835eff","resolution":{"observed_at":"2026-08-06T15:18:00.526219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.483686Z","title":"Scaling up video summarization pretraining with large language models","venue":null,"work_id":"d42c3b2d-fecc-4c22-94a2-e367e680f6ba","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.732501Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:1f341c18ff6ebea2dc6de66b36a79f88f8d7ff01a55a53aab050c1cee20e5a21","observation_id":"f06a89c7-b8a4-444d-a8e3-b2d4a61b9262","resolution":{"observed_at":"2026-08-06T15:18:00.494069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05130","last_updated":"2024-12-16T02:20:31Z","snapshot_observed_at":"2026-08-03T21:21:39.149039Z","submitted_at":"2023-10-08T11:41:28Z","title":"Fast-DetectGPT: Efficient Zero-Shot Detection of Machine-Generated Text via Conditional Probability Curvature","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05130","snapshot_observed_at":"2026-08-06T15:17:57.742908Z","title":"Fast-detectgpt: Efficient zero-shot detection of machine-generated text via conditional probability curvature","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.742908Z"},"links":{"cited_paper":"/paper/2310.05130","citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:e72fa662a3ad4711942ba6a87617ace238c590aa254a94c66ea21d218b090c3f","observation_id":"9d250bf7-c4b0-4f42-a71a-659e9ba1c1da","resolution":{"observed_at":"2026-08-06T15:17:57.742908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.754625Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.754625Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:1d9c925ecac4b31faa736403c131c6f9e29bf95bd5438994c38cddc4edb0fd83","observation_id":"c5e70f11-e328-4a11-9644-a2a5d94b2764","resolution":{"observed_at":"2026-08-06T15:17:57.754625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.437938Z","title":"Personalized video summarization by multimodal video understanding","venue":null,"work_id":"007c825c-77ed-493e-a28d-ee2c48ef31f2","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.772859Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:edf2779a45313048bc12656bbcdf2bf75bd1381692d6407d8655676059e8763a","observation_id":"971a1022-1cae-47db-bb32-8a8d388802f9","resolution":{"observed_at":"2026-08-06T15:18:00.446030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.780042Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.780042Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:048521c381c03e03d127c64003dffc4a4ea69bf3b9a35dd114e10d5f33114c6b","observation_id":"2df36854-e189-4c3a-bb60-8d9fccec8895","resolution":{"observed_at":"2026-08-06T15:17:57.780042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.384269Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"2600ac2d-9624-416a-a2cd-dca9a4cffe5f","year":2017},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.794841Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:c267bdacda777a07775accc734a3414ee064ff04c69acb8797b35979600980c1","observation_id":"2f9c3627-2e56-4a5e-84c9-3cce8d9556ee","resolution":{"observed_at":"2026-08-06T15:18:00.397974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.347399Z","title":"Creating summaries from user videos","venue":null,"work_id":"3360a8fb-8394-40f4-88de-cccd64778477","year":2014},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.805901Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:dc689afc294acaeff86e0042a896d876a238b9124d31df42af00e79595ed2edd","observation_id":"6f3e2665-8d99-4161-b88d-a1bbf8e26051","resolution":{"observed_at":"2026-08-06T15:18:00.361373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.301465Z","title":"Video2gif: Automatic generation of animated gifs from video","venue":null,"work_id":"9680f71e-f6e3-49fc-b887-f7efd7df0a89","year":2016},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.813044Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:7521a125a558353d3ace1da74175ba07928cc1db32d9783b91cdd7eff996fbd8","observation_id":"2e82b1b4-5224-40cd-9210-3ccff6cd019a","resolution":{"observed_at":"2026-08-06T15:18:00.314682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10300","last_updated":"2025-02-05T09:57:59Z","snapshot_observed_at":"2026-07-06T17:03:56.263404Z","submitted_at":"2023-12-16T03:17:30Z","title":"Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10300","snapshot_observed_at":"2026-08-06T15:17:57.824025Z","title":"Shot2story20k: A new benchmark for comprehensive understanding of multi-shot videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.824025Z"},"links":{"cited_paper":"/paper/2312.10300","citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:5e313eddede195c0a4c997a62499c65e6c4de6e98eb9b982ae0c651f37bd18c4","observation_id":"6b864fc9-9403-4a05-a35b-e0262781c528","resolution":{"observed_at":"2026-08-06T15:17:57.824025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2404.12353","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.518311Z","title":"V2xum-llm: Cross-modal video summarization with temporal prompt instruction tuning","venue":null,"work_id":"da50309d-c6b8-4215-81de-3fe0825bf304","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.833243Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:8069e0b760a6a71da5ecd16256c8657a60619fec6c04268fafa37d23aca40a4b","observation_id":"5b936faf-0f4c-404c-995e-7bdbeb775617","resolution":{"observed_at":"2026-08-06T15:17:58.535719Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.266092Z","title":"Movienet: A holistic dataset for movie understanding","venue":null,"work_id":"be4cab41-da3f-4ce2-986d-d42c8785faad","year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.850713Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:82f55c9e959c0f235d130d59701e3d72ebfd65a68a0fd3b33cadd706393cefe4","observation_id":"178f61e5-5ca4-4ccb-bd6a-6b78c0c7cf7e","resolution":{"observed_at":"2026-08-06T15:18:00.274641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.210560Z","title":"Video summarization with attention-based encoder--decoder networks","venue":null,"work_id":"7f847b56-d4b3-419d-8890-07bc972d4ab4","year":2019},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.866956Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:774f3d447da7a040f847955086d609dc77b9e50027fbd3fd5f120df2c13bd5ce","observation_id":"100bc01e-0ebb-4d22-a71c-1079ae8835d8","resolution":{"observed_at":"2026-08-06T15:18:00.233683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.878808Z","title":"Mdetr-modulated detection for end-to-end multi-modal understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.878808Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:55a374da2ffe0ebc6ae4e49883d68f4ef60d92ef7eebe05827aaeaa2a9e34014","observation_id":"b5e92f8f-3ef2-4c14-a09d-c8b297af2f97","resolution":{"observed_at":"2026-08-06T15:17:57.878808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.889332Z","title":"Self-attentive sequential recommendation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.889332Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:cf3061480bcbe24f650f46817061db1fe856473f3656237d4161a6d198cadb4f","observation_id":"78658a8a-e7bf-41e2-9f1d-5f2293280a20","resolution":{"observed_at":"2026-08-06T15:17:57.889332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.084093Z","title":"Tvr: A large-scale dataset for video-subtitle moment retrieval","venue":null,"work_id":"f2e25232-40d9-490d-88bd-79c167847ffc","year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.894979Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:9dcf657407a3651210f2125c85666bf5bab205c715f3e31970351aa886b836dc","observation_id":"34c922f3-384c-43b9-822b-ac4b3f72e2e4","resolution":{"observed_at":"2026-08-06T15:18:00.099995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.900813Z","title":"Detecting moments and highlights in videos via natural language queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.900813Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:ca5f900ffaa2a44224bab4c577bb5e0f5bfe33e8900adb185c7c178350f06ad4","observation_id":"92b3b6c7-adb3-4da3-8832-cbbe029447bf","resolution":{"observed_at":"2026-08-06T15:17:57.900813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00200","last_updated":"2020-09-29T20:37:17Z","snapshot_observed_at":"2026-08-04T07:19:10.375553Z","submitted_at":"2020-05-01T03:49:26Z","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00200","snapshot_observed_at":"2026-08-06T15:17:57.908906Z","title":"Hero: Hierarchical encoder for video+ language omni-representation pre-training","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.908906Z"},"links":{"cited_paper":"/paper/2005.00200","citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:22cbaeddc0394f987c9c0b80f3068263b4b286cc292492f5f9fda8e119cd88a7","observation_id":"1186ada7-6db8-4df6-9898-174df4cae153","resolution":{"observed_at":"2026-08-06T15:17:57.908906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.994136Z","title":"Univtg: Towards unified video-language temporal grounding","venue":null,"work_id":"8181aff0-4e7f-43f8-ac1a-f15ade09383b","year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.915019Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:26a6ea5157f288397fc710218b9956218119ffffc641a6ddd6175ed54b29beef","observation_id":"2fffdc20-b80c-4b42-ad59-a56ad77212c1","resolution":{"observed_at":"2026-08-06T15:18:00.005787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.923338Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.923338Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:d2ba7af32044aac11c72c87940059bd0bb63741ce7a3debe68f2bdc029dd9bf2","observation_id":"d74afcc3-c1aa-4ae7-93cd-14992b383a2f","resolution":{"observed_at":"2026-08-06T15:17:57.923338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.934186Z","title":"Attentive moment retrieval in videos","venue":null,"work_id":"33294b9d-6018-41fd-b4e0-08cc518e857f","year":2018},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.930475Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:7ab066cc4dd059698a3d100f841179f8fdf5e0b078f9f7dc01c4e85add4aa8f4","observation_id":"fbe27845-2ba9-4e8f-afa8-131644f5e416","resolution":{"observed_at":"2026-08-06T15:17:59.942980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.910238Z","title":"Multi-task deep visual-semantic embedding for video thumbnail selection","venue":null,"work_id":"89a549c9-d1fa-4795-88a8-f7f1bd0ad91a","year":2015},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.938843Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:a2e4cb00cec839c677910a94116cf5fe96ea6925f469a869904d349e4cbacbdf","observation_id":"cb57efb1-20af-4de0-9b32-4c036c771603","resolution":{"observed_at":"2026-08-06T15:17:59.916236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.888577Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"a2dd4e55-e1c3-4b2f-a2a3-21210c40c87e","year":2022},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.950702Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:10ef1436de883c9be1c9c938004f711e29d0d74285392e71ae0c407674981dd5","observation_id":"200f224b-e477-4969-b44a-eda34a757df2","resolution":{"observed_at":"2026-08-06T15:17:59.894062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.845217Z","title":"Debug: A dense bottom-up grounding approach for natural language video localization","venue":null,"work_id":"c0981c59-0585-4586-baa0-bb5c3f890e29","year":2019},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.959213Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:b91b3d1da9e87e8fc81e5afb21af10c4a19a73c0f9ceb5670880dfdac78035e0","observation_id":"67d4abdc-b013-481e-acd5-af011be4bf6e","resolution":{"observed_at":"2026-08-06T15:17:59.858277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.805721Z","title":"Videoautoarena: An automated arena for evaluating large multimodal models in video analysis through user simulation","venue":null,"work_id":"7c40fc13-f379-44fd-a40e-0502722a161a","year":2025},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.968763Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:03714d8005bfbefed3d8788255bbb560c74213b30b7bd435bdaaea6ead4df279","observation_id":"14265216-7375-4778-b9c6-da0ad1b99330","resolution":{"observed_at":"2026-08-06T15:17:59.813663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.978108Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.978108Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:e34ab5e514af35e498208e57905a2d12d35b79856ec9973b0dd719efedc8610c","observation_id":"6370adc4-c383-4e9f-aa75-86741df5413c","resolution":{"observed_at":"2026-08-06T15:17:57.978108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.736334Z","title":"Detectgpt: Zero-shot machine-generated text detection using probability curvature","venue":null,"work_id":"08e81607-690e-4e60-9d1f-f6df003360a2","year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.986161Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:1e32ca620ce797e651ebbf091095f78628eda926eacc0022d0d3d9fc0be7b9c8","observation_id":"13ca2bd9-7318-45af-a15f-56f231f4b646","resolution":{"observed_at":"2026-08-06T15:17:59.747306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.698303Z","title":"Query-dependent video representation for moment retrieval and highlight detection","venue":null,"work_id":"f7bd2afd-2c1c-48fb-a7c8-5825e1cd6381","year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.997352Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:fb3e3ec5d62f935761ee4148f37b846e8f272462d0eb2829682bf2e14f5ca642","observation_id":"12fcf8e1-6451-4820-ac18-dff6ed7fb08f","resolution":{"observed_at":"2026-08-06T15:17:59.706354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.661409Z","title":"Clip-it! language-guided video summarization","venue":null,"work_id":"425c95a2-f725-4f1b-a0de-7ee3fbee8c0e","year":2021},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.005873Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:2b37a34257b307acb363a4bcee721378430fe40b1fc3d98b2a0d14ea049fe54d","observation_id":"cf66e6ea-cd8a-4ed0-b290-2fcea3507307","resolution":{"observed_at":"2026-08-06T15:17:59.673686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.623245Z","title":"Sumgraph: Video summarization via recursive graph modeling","venue":null,"work_id":"081f6a54-b3e4-4731-8f74-1586a2ce43df","year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.011349Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:8e4cbf806eb725c63c4457d5f3ca2a151158bd59a7d8215f9be996ec92566e86","observation_id":"69e54f2b-58c6-4089-b36f-483ebc85c181","resolution":{"observed_at":"2026-08-06T15:17:59.632181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.576770Z","title":"Mmsum: A dataset for multimodal summarization and thumbnail generation of videos","venue":null,"work_id":"25948ad4-d892-4d03-858f-ec588e088706","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.017617Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:fa66f60789c0b58d4138ced8db50b91c1ece03843571697fe78137a7c7a4d30c","observation_id":"0fe70fca-d3e8-468f-bda8-39f3cd0bbfde","resolution":{"observed_at":"2026-08-06T15:17:59.587725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.026255Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.026255Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:e9db457834a5fe1a2127ffb05241562d61cdf3f1f539a5667fde9a11b61602d9","observation_id":"612b5a05-1947-4417-b6d6-ed88046ad67c","resolution":{"observed_at":"2026-08-06T15:17:58.026255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.495915Z","title":"Bpr: Bayesian personalized ranking from implicit feedback","venue":null,"work_id":"b530acce-f8b9-45aa-9d5e-41f265d4f880","year":2009},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.034667Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:643f35ae06ba54993cc4ba728b6a076351d5ea4d17ae7642a3b4fb19482f9383","observation_id":"12a5c193-1394-4a55-9fd9-3744ba6d020d","resolution":{"observed_at":"2026-08-06T15:17:59.508037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.453134Z","title":"Adaptive video highlight detection by learning from user history","venue":null,"work_id":"b661fc26-a494-466b-a09b-94d4ddaa45f8","year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.042738Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:d75e2af8edd2cc5db0e23a7eef868254be47f0d8244b2562895fc7d932683a66","observation_id":"fbca70f4-3f80-48e4-90c8-484a13ac1b35","resolution":{"observed_at":"2026-08-06T15:17:59.462359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.403444Z","title":"Query-focused extractive video summarization","venue":null,"work_id":"660f733f-4212-47b2-a31d-65a387c13116","year":2016},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.048754Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:120df506e0eb577b559e4c4de48f508a885b637db6a669ca58549e547df8f735","observation_id":"778060dd-f944-4ab2-b973-c03a99ae4853","resolution":{"observed_at":"2026-08-06T15:17:59.415123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.370307Z","title":"Query-focused video summarization: Dataset, evaluation, and a memory network based approach","venue":null,"work_id":"cf7e45c4-fdfb-41d1-b5dd-11f88e939679","year":2017},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.054036Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:c8f4779c88335ba2a0503c5e75cbb7449042d1883752b87af2feb242b0f7de32","observation_id":"068a8527-2123-4f8e-b6f3-a414943f5124","resolution":{"observed_at":"2026-08-06T15:17:59.379996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.332821Z","title":"Tvsum: Summarizing web videos using titles","venue":null,"work_id":"f75d4fa4-0f21-4f17-8ae5-d93c04c15828","year":2015},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.061056Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:41fbd0a4b89371438dfe109dca67ac6a07a971202eeed4a73172465c51096e83","observation_id":"15bbd598-720d-4cd9-87df-175cf218596e","resolution":{"observed_at":"2026-08-06T15:17:59.342002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.303742Z","title":"To click or not to click: Automatic selection of beautiful thumbnails from videos","venue":null,"work_id":"55363aac-200d-4e74-9b15-b811e1ba5693","year":2016},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.067085Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:a80080f80195fe187d736a3d2f03b48ac4e294af37276693dfa4de9a2da584ba","observation_id":"fcf77a06-11a7-4cb3-8e6f-e4e37d409487","resolution":{"observed_at":"2026-08-06T15:17:59.312544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.274741Z","title":null,"venue":null,"work_id":"8cab676c-47ce-47b1-a32d-2e343513573f","year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.076964Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:f7a0ba1f1a4ea11b9b6cf8fd5b6a0bfc02287e0d03e78b85277e377b1818a239","observation_id":"a6087fab-8d80-46c5-90a8-546fbb73ef42","resolution":{"observed_at":"2026-08-06T15:17:59.284673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.243433Z","title":"Tr-detr: Task-reciprocal transformer for joint moment retrieval and highlight detection","venue":null,"work_id":"9c976489-36ed-417c-9d92-84f36d2f5f10","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.087219Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:d19cbfdd41cb7975786cf8d39b0597079dd118018966b243c0e1204b9726366b","observation_id":"1600e304-033b-4d22-a5a0-ccfea5bc1e24","resolution":{"observed_at":"2026-08-06T15:17:59.250454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.206681Z","title":"Ranking domain-specific highlights by analyzing edited videos","venue":null,"work_id":"cfdf59f3-992d-44c7-87d9-6b54d1b73639","year":2014},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.099601Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:0b5beb2175a8cfc2289947295965a003887c9173b5aee1f7149fbc053d42a4c1","observation_id":"4fedb22b-42da-4fab-a4e1-2b9bc923309d","resolution":{"observed_at":"2026-08-06T15:17:59.215237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.161316Z","title":"Query-adaptive video summarization via quality-aware relevance estimation","venue":null,"work_id":"41f3ba62-edd1-4705-a211-2e04216b8544","year":2017},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.108373Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:b445edeb224dbedb7a7466cae4eec209d0b23285a9e6f8a351d09a0b14bfe20e","observation_id":"87556897-de50-49d6-ba8a-993fb85164d3","resolution":{"observed_at":"2026-08-06T15:17:59.175888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.113681Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.113681Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:4d4d779d31d7fe16f3b84a40b9f6ad55ae7526ebeca41fa0b09ffa68523d0753","observation_id":"11843b59-aebc-42d7-a3f9-d711aec94c8c","resolution":{"observed_at":"2026-08-06T15:17:58.113681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.085480Z","title":"Query-biased self-attentive network for query-focused video summarization","venue":null,"work_id":"7399e7b3-a24e-4a2b-81c1-2fcc863c3b61","year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.119440Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:14aec66eff63168573772548608f384d57b25bdf51dcf6eeceef21fa1f054106","observation_id":"5b6a1701-91b5-4a9e-a64b-4b4a2456f62c","resolution":{"observed_at":"2026-08-06T15:17:59.096946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.044732Z","title":"Convolutional hierarchical attention network for query-focused video summarization","venue":null,"work_id":"9f0e88aa-8b93-4da1-92b7-708e5e7ddc43","year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.126430Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:4182f425b68eae9e63bbcd790d61d3c6427b1d758abc6a4e3554cea8c08dae67","observation_id":"4b5ea4cb-bc56-48d0-b451-09a8d639da2e","resolution":{"observed_at":"2026-08-06T15:17:59.053131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.003981Z","title":"Bridging the gap: A unified video comprehension framework for moment retrieval and highlight detection","venue":null,"work_id":"ab3e304c-b4b7-42ec-b753-8594906797f2","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.135930Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:e35ba5ab137bfe78ef51a3eb7b30dc4110a3c292e687e3873536ccef2ae2e9fa","observation_id":"fdfec61e-997d-4624-8fe8-0aaf263c8ae3","resolution":{"observed_at":"2026-08-06T15:17:59.017479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.964100Z","title":"Cross-category video highlight detection via set-based learning","venue":null,"work_id":"e4152821-3aa1-4e70-bbde-5f97f0dfd643","year":2021},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.142535Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:eb4c2ce9b2a1af86a2cdcb9dd0809c024bb308a717a2c6982d7361ec75c57c6a","observation_id":"a63772b5-cfef-4cb1-8124-3312178cc852","resolution":{"observed_at":"2026-08-06T15:17:58.977655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.929405Z","title":"Mh-detr: Video moment and highlight detection with cross-modal transformer","venue":null,"work_id":"41a8b21d-e8ac-4bfe-870c-840aae97ed77","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.147689Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:0c50a8051d4be30e78125a4fe368657b2b22d1a9d0fae1446e46e36245b472ce","observation_id":"150ced57-45b7-4bec-a253-c45bab977bf5","resolution":{"observed_at":"2026-08-06T15:17:58.936518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.892785Z","title":"Highlight detection with pairwise deep ranking for first-person video summarization","venue":null,"work_id":"ad3978f3-554c-4d44-b7b7-449a1b032f22","year":2016},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.153170Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:4d1e5919627fbdd43a732cbbc67768e86e94a7d3e8e2bd3fea4d77fc40869fb7","observation_id":"ed1d3f71-31c3-44a2-8ad1-67beec4c60e7","resolution":{"observed_at":"2026-08-06T15:17:58.909446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.861889Z","title":"Semantic conditioned dynamic modulation for temporal sentence grounding in videos","venue":null,"work_id":"579611e2-6f7e-43d3-9f7f-aacf8f084c10","year":2019},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.158832Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:b4ca77dce148c46242efe660992e791aeafd25f1633173ad49d506c5a5a2d6f0","observation_id":"1326983a-f5e9-476d-af92-e90ef741f5d4","resolution":{"observed_at":"2026-08-06T15:17:58.872839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.826389Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":"0fc05811-252f-434b-835c-79885fa1803e","year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.165948Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:323837f8430029a1478c810d9a644363ad466e08dc2b6180208a73f2aa0b7468","observation_id":"bf2b387c-6436-4f76-a3e4-5da413d9b1f2","resolution":{"observed_at":"2026-08-06T15:17:58.836105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.799377Z","title":"Moment is important: Language-based video moment retrieval via adversarial learning","venue":null,"work_id":"0797b6a1-08ea-4298-848e-dcdc50be119f","year":2022},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.174479Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:f5da3182bcf49fe5f529c3b2eb76df0b6c332a1ee30557e51e3c2d2e46b5e2d4","observation_id":"04726dc6-2e68-4748-91af-cb19249712e3","resolution":{"observed_at":"2026-08-06T15:17:58.809922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13931","last_updated":"2020-06-14T08:49:07Z","snapshot_observed_at":"2026-07-06T09:16:05.338672Z","submitted_at":"2020-04-29T02:47:04Z","title":"Span-based Localizing Network for Natural Language Video Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13931","snapshot_observed_at":"2026-08-06T15:17:58.184421Z","title":"Span-based localizing network for natural language video localization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.184421Z"},"links":{"cited_paper":"/paper/2004.13931","citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:b44ac7293beb5d67bfc566cd6eb4eca223e5d18d8063621cd208b8fb2b764898","observation_id":"8d2e8ea1-3eb3-4cce-b704-39e7b0c783fe","resolution":{"observed_at":"2026-08-06T15:17:58.184421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.770013Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"0a4edb8b-e8d1-4dc3-8a53-781493697c2d","year":2018},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.193137Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:1385a33c1b332bbeadba3cba9f912591413df33df1b33ebd19ceba59795835a1","observation_id":"3a048f91-13ce-4e15-b481-71f3410b713f","resolution":{"observed_at":"2026-08-06T15:17:58.779679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.209470Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.209470Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:5158d622cd5eb687da7ffb9485f22db2b72812138b32676c4882d5245ed3a474","observation_id":"8eb3311f-c2fb-43f5-899b-7f6807e76280","resolution":{"observed_at":"2026-08-06T15:17:58.209470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.220624Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.220624Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:90a4e7d153b75096512e9c01e37e236fe86a1858b1856f42580feca5afbbf96b","observation_id":"a8d73be5-de15-45fd-bba3-b628a287f923","resolution":{"observed_at":"2026-08-06T15:17:58.220624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.235989Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.235989Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:766a34e94f6f758015c5ddd7c76979cb7b684c8b445a99d21b80c96544df072a","observation_id":"221f98c4-a519-4b45-af4a-53619fe51ada","resolution":{"observed_at":"2026-08-06T15:17:58.235989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.243690Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.243690Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:3cc25b302a6765052945b8148b244f18e08a961239837233d834b02ce8ed2757","observation_id":"ffbfffb5-013f-445d-90c2-45a901683c77","resolution":{"observed_at":"2026-08-06T15:17:58.243690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T15:09:27.955403Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2507.16873."}