{"as_of":"2026-08-07T00:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8f8ce25cb69da2931cd601d8513c940e80b1e1e8bab877d62898e74b539aabc","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T14:35:51.429187Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.08810/citation-record","integrity":"/paper/2605.08810/integrity","json":"/paper/2605.08810/citation-record.json","paper":"/paper/2605.08810"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.219636Z","title":"The 55th statistical report on internet development in china,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.219636Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:1b6ac2e2fbe51c1e8d16733caf998638d23c821404ee41c567f923cc152d40a0","observation_id":"76cdf153-695f-49f0-91ec-4e890989beda","resolution":{"observed_at":"2026-08-02T14:35:51.219636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.225338Z","title":"Real-time short video recom- mendation on mobile devices,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.225338Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:23f97cff0e32a6e90d38456e78c708c932a86c5e2fa6a85c0d1f33fadcfd92e0","observation_id":"339ce531-484c-4322-ab4f-462a264f9b10","resolution":{"observed_at":"2026-08-02T14:35:51.225338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.230834Z","title":"Dvr: micro-video recommendation optimizing watch-time-gain under duration bias,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.230834Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:12b24a867dc9983876f32e89b13a45597357aeed6b692392ef787023b8255ed7","observation_id":"50b22155-9f25-4459-bf4f-bdbde01ed687","resolution":{"observed_at":"2026-08-02T14:35:51.230834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.236468Z","title":"Improving micro-video recommendation by controlling position bias,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.236468Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:acc78874d17d77ffc4ada768cae5aff6581c9ff568c07183330aa1dfe963af86","observation_id":"47b07150-fc51-4bba-a3ef-a4ebcbcb5ca9","resolution":{"observed_at":"2026-08-02T14:35:51.236468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.241144Z","title":"Dancelets mining for video recommendation based on dance styles,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.241144Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:4325bbf7d1f1263c4b7c57c859e424e78b0cadac5636f8f2adbb62acfd0c8658","observation_id":"25e6a14e-e638-4894-85d9-6948ef9b2eaf","resolution":{"observed_at":"2026-08-02T14:35:51.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.246790Z","title":"Concept-aware denoising graph neural network for micro-video recommendation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.246790Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:238265d48821fe596ae5d1b0ac696b197b68a0536416a6740c1007171f26b13a","observation_id":"041947d9-7504-4e45-af74-c0e96f0357bd","resolution":{"observed_at":"2026-08-02T14:35:51.246790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.252050Z","title":"Kuairec: A fully-observed dataset and insights for evaluating recommender systems,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.252050Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:66fa305efc1925ba190ef56b8fd220a7a663d6e8cb76ca9388b6bd59f37039bc","observation_id":"4ff81a2b-08cd-4e5b-a6de-a582b865bcf3","resolution":{"observed_at":"2026-08-02T14:35:51.252050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.256793Z","title":"Tenrec: A large-scale multipurpose benchmark dataset for recommender systems,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.256793Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:b97e174922fe3e97a0ce850df8bce928ca792f25a99a326f6c273b3aca170e5d","observation_id":"26598392-6171-4f2e-aa2d-beb47635536e","resolution":{"observed_at":"2026-08-02T14:35:51.256793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.261182Z","title":"User-video co-attention network for personalized micro-video recommendation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.261182Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:bc80ff59cb897eb1cefb61337cce3edaca2ccfe59ce39a6686de90b35b0dd9b6","observation_id":"f599b824-ae1c-425a-8f3f-2c87d94cf77f","resolution":{"observed_at":"2026-08-02T14:35:51.261182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.265556Z","title":"What aspect do you like: Multi-scale time-aware user interest modeling for micro-video recommendation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.265556Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:e229c88c169e7d57e8607b5683457a3d7ff20cf88ee0f8b12af651db38325172","observation_id":"7fdef38c-213d-4e19-b8ae-bb696819639e","resolution":{"observed_at":"2026-08-02T14:35:51.265556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.269977Z","title":"Semi: A sequential multi-modal information transfer network for e-commerce micro-video recommendations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.269977Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:7556eac8602a89e80f15ffacb48bc608ed6c3ae41bded79469456cda98895de8","observation_id":"48a13b05-15e3-42bd-bf8a-b94e03a3379a","resolution":{"observed_at":"2026-08-02T14:35:51.269977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.274899Z","title":"Short video segment-level user dynamic interests modeling in personalized recommendation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.274899Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:da859c2bdd10cfb03fb5d1adac3f8bca675963d1e0591f5da685efcb111f301a","observation_id":"9628d789-201d-4051-bcc6-48692074432c","resolution":{"observed_at":"2026-08-02T14:35:51.274899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.279326Z","title":"Mutual information-aware knowledge distillation for short video recommendation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.279326Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:df029d150e7b5fc4a2e9b036af41b306302a616918b9520af43d059fb5c56eb0","observation_id":"c42ff876-be65-433f-b612-172162be3db5","resolution":{"observed_at":"2026-08-02T14:35:51.279326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.283749Z","title":"A content-driven micro-video recommendation dataset at scale,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.283749Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:6eda4f26152fae5c3ff4abf1249e1285dc0b9d3f4814a160f05fe86b978b45e7","observation_id":"ddad1613-da0a-45cf-a571-6d5b03e874cb","resolution":{"observed_at":"2026-08-02T14:35:51.283749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.288540Z","title":"Describe what you see with multimodal large language models to enhance video recommendations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.288540Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:688b5b363e6b0b3dfca13065b4f4484fa7b001b1f86fc1e05f1437b255d36d70","observation_id":"bdd69854-fb71-49d8-9d50-be4d19e99479","resolution":{"observed_at":"2026-08-02T14:35:51.288540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.292795Z","title":"Exploring the design space of visual context representation in video mllms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.292795Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:abfcc865ff81ac08d24e44a8ccd9e970eb2b2b82263ee4c4d26c9d7e4cb1044d","observation_id":"c42e08bd-fe19-40b0-91f1-22a6f4910d0b","resolution":{"observed_at":"2026-08-02T14:35:51.292795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.302368Z","title":"A large-scale dataset with behavior, attributes, and content of mobile short-video platform,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.302368Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:b2c5ef8b6c45d043a4ce703421da7dc5696e4f1034933c00952c0a79a2b04773","observation_id":"403acc15-6233-467d-be33-f1c8e1840700","resolution":{"observed_at":"2026-08-02T14:35:51.302368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.307153Z","title":"Video swin transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.307153Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:f9410c9dac34f466b1978e138bea98d67da4be66365f8507cfd6559a382ebbdf","observation_id":"c4a9d75d-632f-459f-9d12-dabc341e262f","resolution":{"observed_at":"2026-08-02T14:35:51.307153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.312633Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.312633Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:ac3532d865645008922c2feda40699b00f67482af0b002d963b6891183b5d2d0","observation_id":"863b0f88-d76f-4080-a3a0-9bfadd748935","resolution":{"observed_at":"2026-08-02T14:35:51.312633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.317073Z","title":"Is space-time attention all you need for video understanding?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.317073Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:e161e7691a716346efd6cbb73ba1f84268fef259b949734f18a5bbd26310f548","observation_id":"f270e319-8f52-470c-bf60-6b2781d9d4bd","resolution":{"observed_at":"2026-08-02T14:35:51.317073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.321419Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.321419Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:ad3ef3b7168fa4ba5ee6e8094cdac991a8920694bf82d7b900eafe94d68383aa","observation_id":"50a84117-d91f-44fe-bffa-ec585a65addf","resolution":{"observed_at":"2026-08-02T14:35:51.321419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.325732Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.325732Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:bb48cbea9a4759587b83ddfe433404ac5c55f1ff2a639d0228022064cff27360","observation_id":"9652a1fc-272d-45b8-813f-d365141231de","resolution":{"observed_at":"2026-08-02T14:35:51.325732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.330185Z","title":"Perceiver io: A general architecture for structured inputs & outputs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.330185Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:6f563097e2f78a128bbdf26f0bc5a58518c11faa35060e77f1ae16704d1a1f2c","observation_id":"31c20f99-e670-4f89-a65c-7ac679667699","resolution":{"observed_at":"2026-08-02T14:35:51.330185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.335163Z","title":"Deep neural networks for youtube recommendations,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.335163Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:f94653231fa3e095ef77771b279c1b5f44417ee6c7b187a24b21b767bf1ad3c8","observation_id":"49996039-4a53-46bb-80f1-2817f78b710a","resolution":{"observed_at":"2026-08-02T14:35:51.335163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.339431Z","title":"Self-attentive sequential recommendation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.339431Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:af9a1da1648b0280548d5ac16f4f2560238efda6f738ccd1ecaf622e8e441ba1","observation_id":"f8153e7f-57ed-4df4-a061-c046553b650a","resolution":{"observed_at":"2026-08-02T14:35:51.339431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06939","last_updated":"2016-03-29T14:52:58Z","snapshot_observed_at":"2026-07-31T19:00:00.136727Z","submitted_at":"2015-11-21T23:42:59Z","title":"Session-based Recommendations with Recurrent Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06939","snapshot_observed_at":"2026-08-02T14:35:51.343698Z","title":"Session-based recommendations with recurrent neural networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.343698Z"},"links":{"cited_paper":"/paper/1511.06939","citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:467127a2f6122601ec470108c8f6a2afdfb4e6cf2a5f90d2f517984d19acda65","observation_id":"5a4698f8-4752-437f-8389-e327cafda4af","resolution":{"observed_at":"2026-08-02T14:35:51.343698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.349529Z","title":"Mmgcn: Multi-modal graph convolution network for personalized recommendation of micro-video,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.349529Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:82639fc23c47b41dcaf363cde985408a9ff6f362510acabbdd975dbba28ca313","observation_id":"2c1752f4-5008-441a-84fd-7b301a047a9b","resolution":{"observed_at":"2026-08-02T14:35:51.349529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.354553Z","title":"Where to go next for recommender systems? id-vs. modality-based recommender models revisited,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.354553Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:7f648ee2712c51ad2a16bd5bfdc12f6fdcda6784321f6567e5359fd64dc698ce","observation_id":"0939598c-99e7-43a0-80e1-b34bb59071bb","resolution":{"observed_at":"2026-08-02T14:35:51.354553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.359545Z","title":"Content-based video recommendation system based on stylistic visual features,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.359545Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:731f3e45de7d3504c1e6bde598f4c90db34bf54b226d5a31c90f3e85e9f5a25c","observation_id":"03b765fd-3cea-44a0-af6f-31abbd2e5c25","resolution":{"observed_at":"2026-08-02T14:35:51.359545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.364024Z","title":"Ups and downs: Modeling the visual evolution of fashion trends with one-class collaborative filtering,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.364024Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:e6419b63a0d304bc26db4c5908bcd7f612db3c3c2b876b3ebb273779e552b865","observation_id":"405fc7d7-7fd4-4cf1-8c2b-3bb079868091","resolution":{"observed_at":"2026-08-02T14:35:51.364024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.368543Z","title":"Kuairand: An unbiased sequential recommendation dataset with randomly exposed videos,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.368543Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:b6611c7ecf5799bfa319d061655583f106e021d084e0ebf1440842465dd7adec","observation_id":"3a420ef6-0e35-404c-adc9-196f326b5505","resolution":{"observed_at":"2026-08-02T14:35:51.368543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.372996Z","title":"Kuaisar: A unified search and recommendation dataset,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.372996Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:4c3c9e6f8ef093839f8242789f1917012d86561445f002cd768c490a749bf22a","observation_id":"4eae1bc1-03b1-481b-9619-030ae15a987e","resolution":{"observed_at":"2026-08-02T14:35:51.372996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.377586Z","title":"Large-scale content-only video recommendation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.377586Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:90fb183cf4082c7327fddd729824f4becc229d98743124fd81a8d3d24625846c","observation_id":"72c78c48-3228-4a22-a7ce-44f6502c0d84","resolution":{"observed_at":"2026-08-02T14:35:51.377586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.382579Z","title":"Rethinking the inception architecture for computer vision,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.382579Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:5dbbc2b84983c29c4f35a206981fee8edafb1aed4dbfe75b111c0399d40c96cc","observation_id":"4957f0ee-89ca-47ea-a701-9add9c040b91","resolution":{"observed_at":"2026-08-02T14:35:51.382579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.388860Z","title":"Tiktok-10m: A large-scale short video dataset for video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.388860Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:24d8d7f6a80312bbd6caee069a0bbe15b5f44feab5dc8aaaa68341f630257098","observation_id":"bb294611-9665-4dc8-8781-f6247874330a","resolution":{"observed_at":"2026-08-02T14:35:51.388860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.394041Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.394041Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:979c4dbd2e7647e9fe67c18d1d61677134cbf98358543038bac24bf88fe3182d","observation_id":"66d0ad7c-38ba-44c0-9813-cc77ec600c74","resolution":{"observed_at":"2026-08-02T14:35:51.394041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.399514Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.399514Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:649319e46cf53eb8d3ccb01e526aa209860b0eef521fca78b9750f557e0bd9e2","observation_id":"34ddc241-80da-41b6-b67d-3b49987a44e0","resolution":{"observed_at":"2026-08-02T14:35:51.399514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.404919Z","title":"Otter: A multi-modal model with in-context instruction tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.404919Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:9395b5cfd4ddaa820945ee9a973ff50e522e1626b92c169f08c85e321079a5af","observation_id":"0967e443-7b17-4c05-bc21-0e3f625ffe9c","resolution":{"observed_at":"2026-08-02T14:35:51.404919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.409777Z","title":"Optimal transport for brain-image alignment: Unveiling redundancy and synergy in neural information processing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.409777Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:2e9639b5874f8b65414f3dde0b146fe4afa0dffcc5e4800440df1111d934b19a","observation_id":"da7a147a-214e-44e3-b0a8-d02549632ec3","resolution":{"observed_at":"2026-08-02T14:35:51.409777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.414910Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.414910Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:f20c86aba8126d3a7a3e3d39363b34a081cd1579d004e327acc7327a5a913f1b","observation_id":"38aff288-7ff9-4353-929e-ba8f563c0f9e","resolution":{"observed_at":"2026-08-02T14:35:51.414910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.419884Z","title":"Instructblip: To- wards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.419884Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:694747c83da85e23c7d69a0525302793f727df6ff191ac8773667b36b24e14ee","observation_id":"9d0f9cf7-51dc-46a8-8ca5-cd4f314ded4c","resolution":{"observed_at":"2026-08-02T14:35:51.419884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-02T14:35:51.424252Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.424252Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:a139110febb11511cf5116886bf7479d7aa472c4852a51baaadec83c89a969de","observation_id":"3117a0e7-1869-4a84-9b8d-38cabfe63fdd","resolution":{"observed_at":"2026-08-02T14:35:51.424252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01696","last_updated":"2021-09-03T18:27:52Z","snapshot_observed_at":"2026-07-06T11:44:12.178092Z","submitted_at":"2021-09-03T18:27:52Z","title":"Revisiting 3D ResNets for Video Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01696","snapshot_observed_at":"2026-08-02T14:35:51.429187Z","title":"Revisiting 3d resnets for video recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.429187Z"},"links":{"cited_paper":"/paper/2109.01696","citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:450e0072d4382fd9569e52a6c23ce9821b5f4f602f8f77c268e1ead02e6f4ad5","observation_id":"deccd610-eea2-4bbd-b257-3d7de85c4aef","resolution":{"observed_at":"2026-08-02T14:35:51.429187Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:35:51.297407Z","title":"Available: https://openreview.net/forum?id=UN6Ik6OCx8","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T14:35:51.297407Z"},"links":{"citing_paper":"/paper/2605.08810"},"observation_digest":"sha256:8021bcf09dbdf37efa48b9a3ebdf844b553b87e917fa3c750ee7907fa60db6d6","observation_id":"6613cf3d-3833-452f-82af-46844e7e9756","resolution":{"observed_at":"2026-08-02T14:35:51.297407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.08810","last_updated":"2026-07-28T23:25:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T14:35:49.955761Z","submitted_at":"2026-05-09T09:02:20Z","title":"Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2605.08810."}