{"as_of":"2026-08-09T02:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca3a9f50f51d5c311644a5cd9bfd64576423452be9d997aaca6f98c0103fbbea","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:52:15.689430Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.09789/citation-record","integrity":"/paper/2508.09789/integrity","json":"/paper/2508.09789/citation-record.json","paper":"/paper/2508.09789"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-06T22:24:48.588621Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-05T20:52:11.898760Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:11.898760Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:db8a1b3f11324f0f377e6c600e321b60c5410ce95f4bd49c2fa366bbab2231ab","observation_id":"d055120f-4662-453a-a739-5b0970657c43","resolution":{"observed_at":"2026-08-05T20:52:11.898760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-07-06T17:55:36.748672Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-05T20:52:11.947587Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:11.947587Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:b73d32858fe239d75e58262f4a5f3b43cf0de3bf4fa53711e2b0335a3c2f239c","observation_id":"53afb53d-4905-43c0-bc65-1518f0ee4249","resolution":{"observed_at":"2026-08-05T20:52:11.947587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T20:52:12.075305Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.075305Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:95baef1df9439fe222f11e5449db474dc9884f30eaecd4d9dc8042b734c9a76b","observation_id":"3d50f3c6-2f7b-43f7-824d-93dd7f258105","resolution":{"observed_at":"2026-08-05T20:52:12.075305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:12.159645Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.159645Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:b741d9942d57167c526bfe510f9ac6f6a5066e0bab3751a47ef3a71e1dc457cd","observation_id":"4aea27eb-a000-40ae-97d5-04cafad7297d","resolution":{"observed_at":"2026-08-05T20:52:12.159645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-05T20:52:12.243640Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.243640Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:e4419bbe97fca71ab2db84ec1c4692ad345cb5feb5e1694e757ebd9e548e91ac","observation_id":"b29ad16e-a2c7-41a8-9d88-dc69fd749e74","resolution":{"observed_at":"2026-08-05T20:52:12.243640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02992","last_updated":"2025-09-12T10:13:54Z","snapshot_observed_at":"2026-07-06T19:45:25.884330Z","submitted_at":"2024-11-05T10:53:25Z","title":"Efficient and Effective Adaptation of Multimodal Foundation Models in Sequential Recommendation","version":2},"cited_work":{"arxiv_id":"2411.02992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02992","snapshot_observed_at":"2026-08-05T20:52:16.252010Z","title":"Efficient and Effective Adaptation of Multimodal Foundation Models in Sequential Recommendation","venue":"cs.IR","work_id":"327be09b-f3ce-41cf-a4be-ff71cbafa11a","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.334243Z"},"links":{"cited_paper":"/paper/2411.02992","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:69e174020d63c9a60dcd2b5c08000b6890930c166a70905469fc4473a0db2dbc","observation_id":"6575eda3-5343-4888-aed5-b0c5c45f7e7b","resolution":{"observed_at":"2026-08-05T20:52:16.342181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:12.424673Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.424673Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:d89c8155d66bd7b357a7c8dbce9c7d4e27937b55891ec3487fd5500bc2943557","observation_id":"79b52895-6a8c-4903-a674-86fdbc6965f4","resolution":{"observed_at":"2026-08-05T20:52:12.424673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:18.080846Z","title":null,"venue":null,"work_id":"53398f1b-2e62-4791-9d20-85fea9abd30b","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.502619Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:73e504ebef5fc56915954a737cf30b947ad6b7ef59a36201622bf63311a317b4","observation_id":"49c69ce7-a34f-4d91-bc08-3387ece6a749","resolution":{"observed_at":"2026-08-05T20:52:18.133375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:12.593453Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.593453Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:36a4f893c852f33bf2c4d94f83e35162f1611dce0396dd667bad4f0e6a0289ee","observation_id":"4aa7b084-5a4e-4ce3-95fa-6f81d215c617","resolution":{"observed_at":"2026-08-05T20:52:12.593453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:12.694792Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.694792Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:fa37385509cbd4a924879d4b3cb967f87637d40eb90fbdfb2bcc693c8c002255","observation_id":"d83c8282-6656-421f-8d58-e1728c634d8e","resolution":{"observed_at":"2026-08-05T20:52:12.694792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:17.916128Z","title":null,"venue":null,"work_id":"6485c26b-3f1f-45ff-a59d-d8cf30787548","year":2017},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.749307Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:de6c0175c576a74b97fb51fbb1ebcd9d78f23d8c3d8401e3dd89f8f8629c1dfb","observation_id":"daceec4b-7953-42e4-aafc-dbeb36d89a7a","resolution":{"observed_at":"2026-08-05T20:52:17.968385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:17.755361Z","title":null,"venue":null,"work_id":"792b1d6a-6942-41e7-93c4-00b9c51b8788","year":2021},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.799997Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:6351e5392ccc5b9d22424358ed87e88d547b1aca07e3c5ff41195e6539fbb266","observation_id":"06700e41-578c-4819-8852-7093726e7337","resolution":{"observed_at":"2026-08-05T20:52:17.807895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:17.618933Z","title":null,"venue":null,"work_id":"e447ccf7-f127-480b-8096-151bc2579dda","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.872360Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:51e5a9c0d7a4d18fb8de2babdac80114ff4a93a8edc95f51d15785c75c05cf2c","observation_id":"76eb33c5-c78b-439b-82b7-0bd79bf9d56e","resolution":{"observed_at":"2026-08-05T20:52:17.678604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:12.924826Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.924826Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:0f844b9996e77270261208b961945e596b05c91c29277d2342c9b60190a90891","observation_id":"48250b28-9d41-47ee-8236-f27f6671d5d9","resolution":{"observed_at":"2026-08-05T20:52:12.924826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.023547Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.023547Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:0cc15d895b8b10ca425937b07ea94de76b17457602692f7e484e51b326308dfc","observation_id":"0722b8c9-6e91-4875-9b84-370a8afe9d33","resolution":{"observed_at":"2026-08-05T20:52:13.023547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.052971Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.052971Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:14f693b71d313e95b28c077bc63f2739daf8128e69a4bac189dc05e14ebe168c","observation_id":"a24d9033-1080-4dbb-b9ae-991b08888aea","resolution":{"observed_at":"2026-08-05T20:52:13.052971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15379","last_updated":"2023-09-27T03:15:52Z","snapshot_observed_at":"2026-07-06T16:24:10.053246Z","submitted_at":"2023-09-27T03:15:52Z","title":"A Content-Driven Micro-Video Recommendation Dataset at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15379","snapshot_observed_at":"2026-08-05T20:52:13.166472Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.166472Z"},"links":{"cited_paper":"/paper/2309.15379","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:bf9dae6c53fa7874b5a9a95ab7a0681e3689afc3dc5b8d8130eef32aaeeb6410","observation_id":"bcbbc6c5-14c3-40dc-a0a5-f4e39207f35e","resolution":{"observed_at":"2026-08-05T20:52:13.166472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.243785Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.243785Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:280867a65c663e78664dd010cc2f093911b1753b1e7cf74f7d1aad8fc0fa963a","observation_id":"6e5ab421-3e45-40ec-be4f-91e26bdca6c6","resolution":{"observed_at":"2026-08-05T20:52:13.243785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:17.417614Z","title":null,"venue":null,"work_id":"99760074-198e-4262-8afc-8cc60f649267","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.318919Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:079109b76d324d934aca44fa643a41e898e25d20a783e2af4b24c571cc135dcc","observation_id":"a42f05f0-5664-461f-a87a-80e70907432c","resolution":{"observed_at":"2026-08-05T20:52:17.489037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.429880Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.429880Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:40ee7538dbb6170b07d42bb113ae2447d6e123d141ef0bf40a1b4f27816ab393","observation_id":"aac5cf76-5701-4a05-a699-4286a25a570f","resolution":{"observed_at":"2026-08-05T20:52:13.429880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.545944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.545944Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:9cad09c0339b5839aa22e427a2061a35fd26b8bc12b5894e4c20f9c0d7b6720c","observation_id":"76c6d758-ba70-4ca7-aad7-346e57c4aae1","resolution":{"observed_at":"2026-08-05T20:52:13.545944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.621368Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.621368Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:ff3841ab6f2d4805dedfac44833bb403f77a852a2387631d19a32114e540b9d3","observation_id":"127ea34d-e05c-456e-a5a0-9b5b23904366","resolution":{"observed_at":"2026-08-05T20:52:13.621368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:17.217165Z","title":null,"venue":null,"work_id":"d32651e0-f675-47c9-a5ba-2310c6bd80d4","year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.698637Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:5af55d7bb5f345340f2e4e5b8c1452ae16f9451ef1f438f5c6d5f0fad34c2572","observation_id":"c1959898-0515-44cc-a1f7-c8d94f9be27c","resolution":{"observed_at":"2026-08-05T20:52:17.311605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:17.044931Z","title":null,"venue":null,"work_id":"b48deb69-3206-4986-9344-e2b0e200d752","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.771710Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:874035e384dce5c5589ec55072324704c921b215671215da2a1074c1e68b40c7","observation_id":"2594f7c6-066a-4613-b4fe-76768d84fb52","resolution":{"observed_at":"2026-08-05T20:52:17.121366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T20:52:13.893223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.893223Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:bfaf9c39b03e2e83f24cfcb100ea21935fa1b13496ac7adb4f122308f1cf8b38","observation_id":"97a12b12-cc48-407f-ac8f-54f3433ea9cc","resolution":{"observed_at":"2026-08-05T20:52:13.893223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.977897Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.977897Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:6a90676dd34bffb215c37fc0656d0a2bb003b2b60bf3dae1110bdce30374ea71","observation_id":"ab16a572-6f9e-49a6-b90c-cb56da4db9b2","resolution":{"observed_at":"2026-08-05T20:52:13.977897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:16.892640Z","title":null,"venue":null,"work_id":"046bbce5-54ba-40c9-b415-f34a3fc999ec","year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.071955Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:03271adcf3718e33f6405192058897dd402c40e5f05cd1ee568eb4496e2aa6f0","observation_id":"1f32c961-9e88-48bf-8b6d-ee745e3bce15","resolution":{"observed_at":"2026-08-05T20:52:16.960276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:14.202485Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.202485Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:b7987e64600bd732cbad71a6e8d8244f1e984122c9bb86a49b2bac3fd3f0162b","observation_id":"88e5fd52-a81c-4a8f-87ed-baeef4e07f6c","resolution":{"observed_at":"2026-08-05T20:52:14.202485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07597","last_updated":"2024-09-24T03:01:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-14T10:57:50Z","title":"C-Pack: Packed Resources For General Chinese Embeddings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07597","snapshot_observed_at":"2026-08-05T20:52:14.307646Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.307646Z"},"links":{"cited_paper":"/paper/2309.07597","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:0e6fb7ff3c2ed12f950396ae9cca082ac958c09870c828a4ebafe194162d62fc","observation_id":"7ff7e7a7-7591-4063-abbe-a5a33a89ffb3","resolution":{"observed_at":"2026-08-05T20:52:14.307646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T20:52:14.402114Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.402114Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:e466b98260d7e30009323792aea6c2e8742b658abd23d08323eaf26cf6b3bf28","observation_id":"8a67f889-752a-44de-a832-b79c6c5c6f1b","resolution":{"observed_at":"2026-08-05T20:52:14.402114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:14.485175Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.485175Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:0e66269a99cfaac188e91906a2db0187046bea1cd49d9245f3a512d3b59b2a03","observation_id":"5fb8cb3b-4fec-4145-b173-f02a7cad2cb9","resolution":{"observed_at":"2026-08-05T20:52:14.485175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:14.732843Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.732843Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:d5f373ed6c94dc41f50505e7402ca1355e075b09f00b7c842876b6b3e010b733","observation_id":"915ea390-591b-407b-adfc-d31a928fd135","resolution":{"observed_at":"2026-08-05T20:52:14.732843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10629","last_updated":"2023-06-04T04:00:05Z","snapshot_observed_at":"2026-07-06T14:07:46.643941Z","submitted_at":"2022-10-13T15:57:40Z","title":"Tenrec: A Large-scale Multipurpose Benchmark Dataset for Recommender Systems","version":3},"cited_work":{"arxiv_id":"2210.10629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.10629","snapshot_observed_at":"2026-08-05T20:52:16.043797Z","title":"Tenrec: A Large-scale Multipurpose Benchmark Dataset for Recommender Systems","venue":"cs.IR","work_id":"baed4fb8-0bbb-4be2-85a9-f4f3595644f4","year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.872860Z"},"links":{"cited_paper":"/paper/2210.10629","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:1a39318f6cd2bc2cd8e75eee243452479b2f87c3c7b51b5fab3f10025e9b57fa","observation_id":"36bc5dd1-7a63-4e1a-b7d2-e823b8e7094a","resolution":{"observed_at":"2026-08-05T20:52:16.114245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-08-05T20:52:14.945706Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.945706Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:6a8ad43660b2934b4e6af0b76837494e8e2ac78188fabc06fef64e3190c34142","observation_id":"9ad5f067-a670-4a12-bca3-54a75516314e","resolution":{"observed_at":"2026-08-05T20:52:14.945706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:16.607384Z","title":"Gundavarapu, Liangzhe Yuan, Hao Zhou, Shen Yan, Jen- nifer J","venue":null,"work_id":"a539bc8b-1c62-46df-819b-45cb0b84e8ec","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:15.070733Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:3fd4fef36f7ef74cf2ecca99cda6fbde13783a925a5883b48d6e125272704ea4","observation_id":"c3119bdb-4b74-4f4c-850b-44f8f265f529","resolution":{"observed_at":"2026-08-05T20:52:16.667824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:15.235622Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:15.235622Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:73989435ad211907b9d6caa8d873e1d197878e4494262b3e1fa4267f9d50a482","observation_id":"28361b96-a139-4637-afff-522bf6200c46","resolution":{"observed_at":"2026-08-05T20:52:15.235622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:16.490798Z","title":null,"venue":null,"work_id":"be6eeb43-ba24-439e-a862-a76d8bed6b94","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:15.360641Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:dd44b29645e74910c55718814d42b5373d50e54c266853fb94b67e39458e553d","observation_id":"bcebc30e-fec5-4ecb-b202-52b03f8cc715","resolution":{"observed_at":"2026-08-05T20:52:16.538053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:15.523539Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:15.523539Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:d526d1ce6a03a32b8f701f58473f5b540661c1c72a4e98a5c6a5ee45a76046a9","observation_id":"b261718e-d345-4574-8354-0c6507ea43ee","resolution":{"observed_at":"2026-08-05T20:52:15.523539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"cited_work":{"arxiv_id":"2506.01872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01872","snapshot_observed_at":"2026-08-05T20:52:15.794372Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","venue":"cs.CL","work_id":"3c6f3d45-67e2-4ac1-987b-3d08e95cd474","year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:15.689430Z"},"links":{"cited_paper":"/paper/2506.01872","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:ff13be9ee9373d7a8bf3aba8d73b7e65ee92b9eb2a44cf616794d6c4cb4a87c5","observation_id":"90c7369b-9612-4c3c-97dc-37408295e3d3","resolution":{"observed_at":"2026-08-05T20:52:15.874065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:12.646185Z","title":"InProceedings of the 28th ACM International conference on Multimedia","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.646185Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:4e37e0817c161e379ba3f171632800aa4bf9da0d88c30a77cb5b7240eb8c1d38","observation_id":"d0348ab4-8f7e-4f04-9d18-a5074b52bb5e","resolution":{"observed_at":"2026-08-05T20:52:12.646185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:14.686234Z","title":"In Joint European Conference on Machine Learning and Knowledge Discovery in Databases","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.686234Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:5f816f166413943a92935ff816df73c760262cff9fce6bd75ae1ebac61b82c26","observation_id":"2470fc22-7c73-4485-93db-eaba583f1b46","resolution":{"observed_at":"2026-08-05T20:52:14.686234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:16.746630Z","title":"In Machine Learning and Knowledge Discovery in Databases: European Conference, ECML PKDD 2022, Grenoble, France, September 19–23, 2022, Proceedings, Part I","venue":null,"work_id":"ec0192fe-7e10-4a72-84bf-5eea285da2e3","year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.845228Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:6879b1443cb74498da20d5bcbd76fc184eefec25cfaff87e28038b5ae72ee938","observation_id":"e6791eb2-d322-4c60-8638-505775694151","resolution":{"observed_at":"2026-08-05T20:52:16.791348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":3,"verified_fuzzy":2},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2508.09789."}