{"as_of":"2026-08-12T03:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd0205b879340a0974948f6cea826f9b1270e7d9ba226fd130291b9f85d3e651","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T04:52:12.045880Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.20838/citation-record","integrity":"/paper/2605.20838/integrity","json":"/paper/2605.20838/citation-record.json","paper":"/paper/2605.20838"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"com / JaidedAI / EasyOCR","venue":null,"work_id":"70da881b-697b-4ef8-9b68-ad7e7db39832","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:5e16f514bb93562216e1f0d8f830cbf1f256f3f0c51c6663aae6a440ed554d76","observation_id":"ff876afc-6a36-40ab-9b36-9af33a36be37","resolution":{"observed_at":"2026-05-21T04:53:58.544592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aafa85d0-9049-41d0-9e75-d32915912369","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:c4355ad10842d02edb0c6a0caec6acce7d56cda750843d18afcefa87c9804769","observation_id":"901cd8c9-c185-498f-a3d5-69a8103f57ab","resolution":{"observed_at":"2026-05-21T04:53:58.554433Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6e71dae4-a548-43c2-8bca-834b862b1cf7","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:0fc3769b0229e51fb8d19c764fa4884b6dae6a54cd2e47af7afcc1f380db22d7","observation_id":"b705764f-edd8-4dba-a7b1-ec896af76d48","resolution":{"observed_at":"2026-05-21T04:53:58.537448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"40b5cb78-c629-4aff-a09f-b9dfd1d314d7","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:12825ff314a2fd5003487d1735be4c26d36ae6ba3779140571385b0ae120126c","observation_id":"16e33f42-856c-4b75-b7fc-4d212791d74b","resolution":{"observed_at":"2026-05-21T04:53:58.559443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f084b66a-997c-4946-9872-fa9cdf0ce666","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:d187593b4ff25fd3b664017f088d80bf41b108b2cc6d61416b96c6d290912fed","observation_id":"c3af6144-195c-4050-9a78-346a4e033744","resolution":{"observed_at":"2026-05-21T04:53:58.540984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"com / sloria / TextBlob","venue":null,"work_id":"4ddd40d0-04ea-4e11-80d0-0d4a99b4fd84","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:a8cd23dda9f8dd9fd8694bb662d9245a188e1f2b3dd668136ccf25f5e54c55c2","observation_id":"644911d4-2fef-401d-ae34-c236d945a385","resolution":{"observed_at":"2026-05-21T04:53:58.586712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"838cb086-71d8-4aa0-a075-e34a5a4b142d","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:b1f375cb7adccf14d49c4d379aed7b2eee53c8d9256e41c0dfe110f9f6e57ee6","observation_id":"5aec84b2-4bc6-4034-868c-06651d03e95b","resolution":{"observed_at":"2026-05-21T04:53:58.588531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bf4e325b-18d5-48e9-a24d-3f676e1c11a1","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:86aa7f3ad07ee3686773a1f770e6b893fe0ced7460ee9bfb762c146646d35bd0","observation_id":"4e9b55ba-cb25-45dd-8d89-19f70ca7a017","resolution":{"observed_at":"2026-05-21T04:53:58.584822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"businessofapps","venue":null,"work_id":"23e87c3f-8cbb-47b1-a3d4-f747fb785df4","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:ff53f5dc18fb61d961f0645b53560f8f19441bbc08234e7085c767d98cec13b2","observation_id":"15731782-7fdf-4608-847b-b6c49668ba02","resolution":{"observed_at":"2026-05-21T04:53:58.581523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-06T22:24:48.588621Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":"1609.08675","doi":"10.48550/arxiv.1609.08675","metadata_source":"pith","pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","venue":"cs.CV","work_id":"6b543bd8-75e8-4c53-9718-b4545e4bc424","year":2016},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:f195abe50cc098db4d2a8da39e0bf32b326a83ef7b0906c2e0605bd3fcd670f2","observation_id":"8519ed7c-b374-48da-a38e-ef49ffd1b072","resolution":{"observed_at":"2026-05-21T04:53:57.808325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Localizing mo- ments in video with natural language","venue":null,"work_id":"0fe74adb-c1f5-4414-8e1a-e618d8692dac","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:18fedebd870195a58fb7f13fcf7abe2fffe6bae7aaa01cac751c5195a6e83e6d","observation_id":"6626b449-136c-4bd7-aad5-f7d53897b651","resolution":{"observed_at":"2026-05-21T04:53:58.583201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Look, listen and learn","venue":null,"work_id":"6440fb0a-5f38-43bf-8ae0-4bf72a532376","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:baa784988ea5872aa805e35af4d948eaa766719ac468770ec601b4058150d151","observation_id":"40c0c428-198b-44d1-b8dc-26651fd8ada0","resolution":{"observed_at":"2026-05-21T04:53:58.590301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-07-06T06:54:00.483796Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":"1808.01340","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-07-09T11:16:11.465544Z","title":"A Short Note about Kinetics-600","venue":"cs.CV","work_id":"851b1623-6feb-441e-8849-b07f1753f22e","year":2018},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:686e1cd6f0909d76bdca00617243ed2e10ae488bb31733d1cef17f7f0a0f1256","observation_id":"203898c1-cb93-4315-9785-dffe800451e5","resolution":{"observed_at":"2026-05-21T04:53:57.830162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"2ac03d91-6e07-404e-954c-bf550a907924","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:5398bdc024a18af7732efe97654c621e41e3a57393f6182278258cee96b4791d","observation_id":"e9e93f9e-7bcf-45e0-a799-474b0798142b","resolution":{"observed_at":"2026-05-21T04:53:58.594722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":"03ec720c-4d65-49ac-b9c6-bab05a743e3b","year":2018},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:404ddad9160783c2ce5ab6f02be21e940b2f637778e37f2f28a340a19133231d","observation_id":"0182f6ed-f1de-4490-bbdc-f9c3fd075739","resolution":{"observed_at":"2026-05-21T04:53:58.614855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The epic-kitchens dataset: Collection, challenges and base- lines.IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(11):4125–4141","venue":null,"work_id":"444fff4d-643b-4de1-acab-f5448aad7dab","year":2020},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:b640caa6ade9a21fb499d84fa42ff6e998660a3109e6d511df09fc9a568aac58","observation_id":"20cbedf4-95c9-4956-b705-ac3541108f85","resolution":{"observed_at":"2026-05-21T04:53:58.607842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The youtube video recommendation system","venue":null,"work_id":"bcc78cc4-c981-432f-a443-2e580e73292f","year":2010},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:f7c19d338f351940778f5b81e5e25d279a24d1623ff424d8dfe2ca0dc2f63fe5","observation_id":"026d33e8-03fa-45aa-a196-c5ba545f2629","resolution":{"observed_at":"2026-05-21T04:53:58.643047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9348f179-8fc2-45c0-b0ce-17e6b2a146ba","year":2015},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:bbd38e1ea13d9770d6fc432a9c5f45c3a316d182cffd04d6d7857e1299a91db5","observation_id":"ce4e25bd-20c2-4d95-b511-9f9747c5ae23","resolution":{"observed_at":"2026-05-21T04:53:58.637695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":"1810.04805","doi":"10.1111/jofi.12885","metadata_source":"pith","pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":"cs.CL","work_id":"ed240a10-5b19-406c-baa5-30803f465785","year":2018},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:369f2da17269e9a638537be1308f49eabd6f61177a6aaafb7f3acd9150dc8a21","observation_id":"6c9624c9-7429-490a-8d6d-155d148cc9b1","resolution":{"observed_at":"2026-05-21T04:53:57.832574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large scale holistic video understanding","venue":null,"work_id":"b3ed2b0f-19dc-491d-94ae-a4eb9f1e49b0","year":2020},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:394ff1a4b512e68f7ec747b5051e1501bf234fb291481fa44d27997386ff778b","observation_id":"88e0a802-fd8e-4678-8c44-43c5884d7ff9","resolution":{"observed_at":"2026-05-21T04:53:58.634233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.11451","last_updated":"2020-12-15T06:53:39Z","snapshot_observed_at":"2026-08-11T03:42:57.565710Z","submitted_at":"2019-04-25T16:49:13Z","title":"Large Scale Holistic Video Understanding","version":3},"cited_work":{"arxiv_id":"1904.11451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.11451","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holistic large scale video understanding","venue":null,"work_id":"e68f64ec-228c-4002-b305-62f4f43d7bc5","year":1904},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1904.11451","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:44cd6d7be384ca6794a055e86fb973cf53eee582a4064479a194bd1cd87a8342","observation_id":"816ca43c-6b58-44a0-8f3c-93e3f67b0272","resolution":{"observed_at":"2026-05-21T04:53:57.825012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pyslowfast.https://github","venue":null,"work_id":"e4b7f877-75a8-4a61-a8d8-c301471e87e9","year":2020},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:121cf74d8806e0057310547a73cf0bfd7df6910b0f5028aa0610d1553f899ed5","observation_id":"79949599-e9c2-4169-8717-35902693c6df","resolution":{"observed_at":"2026-05-21T04:53:58.635892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"31e1506f-b78d-47ea-ac57-4fdeff773b02","year":2019},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:d5c1bc21e97c561794ddd9d1c9ec20b61681049c67e83b1479059edccea73442","observation_id":"ae50963c-cd8c-49db-a614-05838d34a89f","resolution":{"observed_at":"2026-05-21T04:53:58.639336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-supervised video representation learn- ing with odd-one-out networks","venue":null,"work_id":"a302c478-b92f-4def-841b-e2828abb7ccf","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:8f3a9f7726e533bb8071d4d23886f57ad1c4154035a336997f3b4e068ff52e5d","observation_id":"e2c013f4-511e-4452-b898-e81114a94569","resolution":{"observed_at":"2026-05-21T04:53:58.626497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"aefde3d6-2856-428d-8eac-ba012127a41c","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:16f6ff5d2f2719a911e1fd70bcc303218ca42410bf45d36e45ed33fa288cf572","observation_id":"5d6791fb-72a0-4885-81c0-c2bf22b8f07e","resolution":{"observed_at":"2026-05-21T04:53:58.628501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions","venue":null,"work_id":"b8cf9215-ae93-4b93-ab38-473f16d53878","year":2018},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:7bc73983bba66af432e610e0e0116bc3882cd28fca509df96864112a8ecbfe20","observation_id":"92dc1cd7-1a68-40f5-ab06-2ff374c53145","resolution":{"observed_at":"2026-05-21T04:53:58.630242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video rep- resentation learning by dense predictive coding","venue":null,"work_id":"0a8bb54e-0b03-4bbf-8fba-372bd1115282","year":2019},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:0b5b14d2b812230a044915dad59adb58064c171b90b014bc154ff6b1843c9bd4","observation_id":"5356342a-f475-4391-8ca9-2d97748288f5","resolution":{"observed_at":"2026-05-21T04:53:58.620549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"43cd57ef-3ad8-4c64-a31c-ab648e2b47be","year":2016},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:55f85e273f2560e9bd5229a522b7c56bd36ad5d31c05b9174735200d04c67371","observation_id":"8fa54744-ddd6-4de7-b7ae-36378d79d66b","resolution":{"observed_at":"2026-05-21T04:53:58.622746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet: A large-scale video benchmark for human activity understanding.2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pages 961–970","venue":null,"work_id":"1704cd12-1677-4f2a-aff7-545beff3b52b","year":2015},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:8bec1f4f7db3927a2965f19fbca517f37bc99df0cbeef31168c4b98b897f6916","observation_id":"5a56fc33-4973-46b4-8c8c-c466bff290c5","resolution":{"observed_at":"2026-05-21T04:53:58.642707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A hierarchical deep temporal model for group activity recognition","venue":null,"work_id":"29eaf112-c1df-4291-bbb4-587cc707a282","year":1971},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:d7e0946564bc77c4ca69cec8923a1161dd1b8e11727e5d2eb61e73acf4ef80bf","observation_id":"4da275d2-7af1-4596-8af0-1bb98553466b","resolution":{"observed_at":"2026-05-21T04:53:58.656369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Query- aware sparse coding for web multi-video summarization.In- formation Sciences, 478:152–166","venue":null,"work_id":"cd56befd-6cb6-4469-ad3a-aa2b2a46b2e6","year":2019},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:5ddc004b32ba1502133dfed98c04dcab1e7c6f3148189a1fcb82b0373fb9defd","observation_id":"082ba956-6261-4c00-8d21-06df14aa8059","resolution":{"observed_at":"2026-05-21T04:53:58.654428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thumos challenge: Action recognition with a large number of classes","venue":null,"work_id":"e79dae89-86f8-432c-97a0-89fe45e5f5ac","year":2014},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:49bae62b872d182c8f4a2e1bc67c10c78c86cb6e1744330b1b171bf701a662b9","observation_id":"76cf20e9-68a4-49ae-9fd2-6072ca26f326","resolution":{"observed_at":"2026-05-21T04:53:58.624549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale video classification with convolutional neural networks","venue":null,"work_id":"e3991577-175e-4f3a-99b2-df67e04b496c","year":2014},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:d6c82c46e0b93801bbefc6e657a42456ef51ea681624a602e2dca29c047b2820","observation_id":"86a0ac54-197b-4e4d-8ada-9737ae8e14c8","resolution":{"observed_at":"2026-05-21T04:53:58.632354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale video classification with convolutional neural networks","venue":null,"work_id":"5c152c89-4486-46fd-ac6a-a27237155d8b","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:27aca255b1b30ab285319e6b7c2066a4cc7ccbe89774cf383aaa071b3768e6ba","observation_id":"89e27a36-1452-4a36-bb6b-e707e6f54cee","resolution":{"observed_at":"2026-05-21T04:53:58.640985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":"1705.06950","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-09T11:16:11.423695Z","title":"The Kinetics Human Action Video Dataset","venue":"cs.CV","work_id":"c8a3de61-cfd3-4aeb-bcf7-a0372c015748","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:7f0af378140951c49da9cd7f72b73fd9f6fc9bfc30a920c9805208db5ddab599","observation_id":"9eea8bdc-159c-458f-9646-fdb207889cbc","resolution":{"observed_at":"2026-05-21T04:53:57.796179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.2539","last_updated":"2014-11-10T19:09:41Z","snapshot_observed_at":"2026-07-06T04:00:05.122784Z","submitted_at":"2014-11-10T19:09:41Z","title":"Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models","version":1},"cited_work":{"arxiv_id":"1411.2539","doi":null,"metadata_source":"pith","pith_arxiv_id":"1411.2539","snapshot_observed_at":"2026-07-02T15:17:07.122405Z","title":"Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models","venue":"cs.LG","work_id":"400e54cd-2c42-418c-82b8-c43bf44e46c8","year":2014},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1411.2539","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:90860b78d08e93665afdada085433d6625982abaf3ec9c2333f7b4fdd20351de","observation_id":"0e1b290d-e503-4de6-9a14-707e777fb2fa","resolution":{"observed_at":"2026-05-21T04:53:57.842984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.00230","last_updated":"2018-11-09T22:20:11Z","snapshot_observed_at":"2026-08-06T17:42:33.310246Z","submitted_at":"2018-06-30T21:50:21Z","title":"Cooperative Learning of Audio and Video Models from Self-Supervised Synchronization","version":2},"cited_work":{"arxiv_id":"1807.00230","doi":null,"metadata_source":"pith","pith_arxiv_id":"1807.00230","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cooperative Learning of Audio and Video Models from Self-Supervised Synchronization","venue":"cs.CV","work_id":"74dc0892-3c30-43ce-99a8-a6e8d9ba409e","year":2018},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1807.00230","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:729719d30ae96772a21b7dce679a80d1b05ea1d5330428ac68b83a60178143bf","observation_id":"228610bb-69c2-4f3f-b093-bb62e44ef332","resolution":{"observed_at":"2026-05-21T04:53:57.822385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dense-captioning events in videos","venue":null,"work_id":"6e4ed3ab-3d8a-49fd-8f65-7fb01e94aede","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:086d419f6e982319950bd3fd9c9b1b268b503f0cacf3834abeb9ea3a195dcd83","observation_id":"4c65784f-f784-4d81-ade0-b6df543c8355","resolution":{"observed_at":"2026-05-21T04:53:58.602063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hmdb: a large video database for human motion recognition","venue":null,"work_id":"32eb9540-7e4b-4e94-bbaa-2093b75729ca","year":2011},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:1bc153e26e5738f183d3da18aa1ec0b86fa5a080e64946fd0f1b4bda9723f81c","observation_id":"0840cfe8-9337-4ed4-bcaa-18e37452d9c4","resolution":{"observed_at":"2026-05-21T04:53:58.603822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised representation learning by sort- ing sequences","venue":null,"work_id":"7f590316-dae2-4b36-9c76-8a8c1b825d35","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:bc4de0876f5323f64b87f9b3f256adebbd4b91e1b3dc3327d27148f47bf3d413","observation_id":"76a1ac55-9124-4e31-a77d-2e8011fffc0b","resolution":{"observed_at":"2026-05-21T04:53:58.600362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06183","last_updated":"2021-02-11T18:50:16Z","snapshot_observed_at":"2026-07-06T10:40:37.508112Z","submitted_at":"2021-02-11T18:50:16Z","title":"Less is More: ClipBERT for Video-and-Language Learning via Sparse Sampling","version":1},"cited_work":{"arxiv_id":"2102.06183","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.06183","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"44f9830f-7491-4c38-b54f-73d74cd714fd","year":2021},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/2102.06183","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:e56dde539e2ee2b6e71fd67e4c1c96abc5b4afe4e97969956f158e116101be90","observation_id":"51298f50-9feb-46a9-8d0c-d5981141c788","resolution":{"observed_at":"2026-05-21T04:53:57.840651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.05691","last_updated":"2021-01-28T01:43:34Z","snapshot_observed_at":"2026-08-10T17:29:43.107061Z","submitted_at":"2020-01-16T08:28:57Z","title":"Learning Spatiotemporal Features via Video and Text Pair Discrimination","version":3},"cited_work":{"arxiv_id":"2001.05691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2001.05691","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning spatiotemporal fea- tures via video and text pair discrimination","venue":null,"work_id":"f9fa1d6c-64f0-4b92-bdb7-a4a98296fd68","year":2001},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/2001.05691","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:4a4e8ba1ca020e67c0dcaac34985f0f3cb258b06ba60c86f69c75ba3a70df5ed","observation_id":"41f40409-73ee-4aed-b6f5-d977c26c61c3","resolution":{"observed_at":"2026-05-21T04:53:57.838074Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual semantic search: Retrieving videos via complex tex- tual queries","venue":null,"work_id":"c1e175b6-5e6a-413d-881e-7963148cf7a3","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:024a3d9bb1ae3356c425e0809ead7e5da859a8bfa4dc2a05e6ab3da7bbda78cd","observation_id":"9c815742-de14-45cd-b6b4-bb0bb8e40f61","resolution":{"observed_at":"2026-05-21T04:53:58.605972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tsm: Temporal shift module for efficient video understanding","venue":null,"work_id":"674c6414-ef52-4841-9de8-00fdc07b5726","year":2019},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:a4fc89ff9dd812d9b7fba6c3a72ab831c0b14e0d80e85290e2f5a5e6f3542aa0","observation_id":"df6edc6d-bc24-4b7c-afbd-0e590442bc7e","resolution":{"observed_at":"2026-05-21T04:53:58.609640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.07475","last_updated":"2017-03-28T01:01:29Z","snapshot_observed_at":"2026-08-06T22:08:43.419055Z","submitted_at":"2017-03-22T00:22:49Z","title":"PKU-MMD: A Large Scale Benchmark for Continuous Multi-Modal Human Action Understanding","version":2},"cited_work":{"arxiv_id":"1703.07475","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.07475","snapshot_observed_at":"2026-07-04T06:09:37.765083Z","title":"PKU-MMD: A Large Scale Benchmark for Continuous Multi-Modal Human Action Understanding","venue":"cs.CV","work_id":"89256588-4275-4a90-8768-a5c838a9feaa","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1703.07475","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:585f3c2e0fec1db73d45719abae5a5ccf96ffcf340cc3e369b0b0cbd1e7f0b85","observation_id":"03308ac7-ee4f-4d74-9333-e54be3360139","resolution":{"observed_at":"2026-05-21T04:53:57.817082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards micro-video understanding by joint sequential- sparse modeling","venue":null,"work_id":"769bc69b-e7f7-4e99-9397-6bf7f6a8d9df","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:4e969ec4a180c755863beb8320a23f97a65b0c14204acec7987f3f5607bca655","observation_id":"b73bc4f7-da0a-48bd-beac-833459a6c27a","resolution":{"observed_at":"2026-05-21T04:53:58.596526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visualiz- ing data using t-sne.Journal of machine learning research, 9(Nov):2579–2605","venue":null,"work_id":"0c3e0e3e-347c-4b8d-a5a3-dae535da6f24","year":2008},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:6f9d83fad5d5b74af02578c2e38bd1d3e9f1d918f31c67fee2ef2b13db71f51d","observation_id":"03e7c293-58ff-4918-8f19-a81bcc62bba1","resolution":{"observed_at":"2026-05-21T04:53:58.598432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The jester dataset: A large-scale video dataset of human gestures","venue":null,"work_id":"2f0e5581-6f24-4347-a76c-1bb43db4381c","year":2019},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:04af02e3804d8acd2170767f3397c9efcf43b956ba36d2b4fc7b154162b3e166","observation_id":"5cfa8307-338c-43b2-86a4-c15a5d20a7a3","resolution":{"observed_at":"2026-05-21T04:53:58.611294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos","venue":null,"work_id":"e32508c4-4ce3-4c76-b3e4-ca1ccd281918","year":2020},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:f4880f4ef8d525c1c663ce10007ac93b43a92dba887549584288b7cea910de20","observation_id":"4e068227-8c32-4e40-a63f-a7b2fd45aeea","resolution":{"observed_at":"2026-05-21T04:53:58.576185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02516","last_updated":"2020-01-16T13:18:58Z","snapshot_observed_at":"2026-08-10T12:19:24.196286Z","submitted_at":"2018-04-07T06:59:45Z","title":"Learning a Text-Video Embedding from Incomplete and Heterogeneous Data","version":2},"cited_work":{"arxiv_id":"1804.02516","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1804.02516","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning a text-video embedding from incomplete and heterogeneous data","venue":null,"work_id":"b83676cf-7897-4079-a7a5-5db3e3b52fc0","year":2018},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1804.02516","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:5685cb58ce9c93b3c19e394102bc4269fa0ea8d43e76bc7ffbad612fd5bcb659","observation_id":"04316950-5876-422d-acfb-ed2ea017f449","resolution":{"observed_at":"2026-05-21T04:53:57.814545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"a792fec6-7c47-408b-a759-2695e710a2f9","year":2019},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:e4712d1bda1477ab6652d5da7a4766caa8cc9eddd41e1b6599873325da8e55fd","observation_id":"56d4ce16-050d-4ab4-9b06-adbc66bd7b55","resolution":{"observed_at":"2026-05-21T04:53:58.578008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moments in time dataset: one million videos for event understanding","venue":null,"work_id":"219f074b-4fb5-418e-8404-420a63168328","year":2019},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:dde964e38ba0cd68874847b0bc5f619d96268768e236e544b3e984da0ed84677","observation_id":"b86f6cf5-f17d-4e65-8e83-f77930905373","resolution":{"observed_at":"2026-05-21T04:53:58.579742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00232","last_updated":"2021-09-27T22:59:12Z","snapshot_observed_at":"2026-07-06T08:34:01.954036Z","submitted_at":"2019-11-01T07:09:36Z","title":"Multi-Moments in Time: Learning and Interpreting Models for Multi-Action Video Understanding","version":4},"cited_work":{"arxiv_id":"1911.00232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.00232","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-moments in time: Learning and interpreting mod- els for multi-action video understanding","venue":null,"work_id":"3b6f498e-39a0-48dd-b3f9-585770b27e1c","year":1911},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1911.00232","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:a980328f73a21f370731985278087003759e317d6c7bb1f5ddc06e1a7f28e0d6","observation_id":"a65bc5b0-5909-4e00-aa76-30d159434846","resolution":{"observed_at":"2026-05-21T04:53:57.809493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal learning toward micro-video understanding.Synthesis Lec- tures on Image, Video, and Multimedia Processing, 9(4):1– 186","venue":null,"work_id":"ba8fa04b-777d-492d-bf88-7aed3ef5f9e3","year":2019},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:acd8b5742c5ee72dbecfc4597f91f3915636c50fbbf7f0780b3e56a1b97771e7","observation_id":"d80d571c-151a-4484-9f47-0b13bdc92fb4","resolution":{"observed_at":"2026-05-21T04:53:58.571701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing micro-video understanding by harnessing external sounds","venue":null,"work_id":"a5ae2f10-24be-4d61-82aa-a36afd1037f3","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:5dffb85c6756e15158d8435daf872bbc47c9468a13b3cf79e1bdedfbbc53ff1c","observation_id":"651867aa-767a-430c-9a9f-0f731bb9dbdd","resolution":{"observed_at":"2026-05-21T04:53:58.594990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A large- scale benchmark dataset for event recognition in surveillance video","venue":null,"work_id":"bae6238b-b593-42e7-9974-1e0bfa572c48","year":2011},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:b3c42cf08e5bc0e73a500983c5b88d82bd6ff029452bd6ad334bbc74f7572d65","observation_id":"5775011b-aab5-4dd5-9019-c0fb76849cb4","resolution":{"observed_at":"2026-05-21T04:53:58.652131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning joint representations of videos and sentences with web image search","venue":null,"work_id":"6f057f0e-133c-403e-bec8-3cf9261a7cfe","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:1907fe8d163a6e99f99598f14e5d8b7e259ea5839d9cf2ccbf3208e4d5e0d6fb","observation_id":"3dd1dc4b-e8b2-41a4-8f09-9eb5c93856b9","resolution":{"observed_at":"2026-05-21T04:53:58.650245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2103.00020","doi":"10.1021/acs.jcim.0c00174","metadata_source":"pith","pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":"cs.CV","work_id":"6de86bb5-27bd-4d5c-8b89-967ebfc52659","year":2021},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:16703060cc924c44c8ecb799cad6b0d5cb9fbdf50862ed40eab5dbbef34e26fd","observation_id":"fd6c52a3-9073-481e-9dbc-537898075de3","resolution":{"observed_at":"2026-05-21T04:53:57.806444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scenes-objects- actions: A multi-task, multi-label video dataset","venue":null,"work_id":"9ac1b7a8-d900-4d7b-a160-449be219831e","year":2018},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:599e9489a5b01b3c2be699222e6d9450ce8aaab0fa1d02cc9b5860013b8bee34","observation_id":"b9a22372-02c1-4e89-a37b-63c5c65a9383","resolution":{"observed_at":"2026-05-21T04:53:58.644724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A dataset for movie description","venue":null,"work_id":"2bc7bbe6-9ce6-427d-a144-51dd6386053c","year":2015},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:33e0262602a190e173dc3336d088996c0bbb8276aa5583627a0987cd642ce540","observation_id":"d3fbbf07-9dea-4fae-b6e6-869e98cd9cdb","resolution":{"observed_at":"2026-05-21T04:53:58.646399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Movie description.International Journal of Computer Vision, 123(1):94–120","venue":null,"work_id":"1bc51d45-cf1b-4a3d-8b96-00b05855f93e","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:795a6eddc60a3d25e929f348e273f7ef1fa977ac6feb13fc56a97b35051d6bdc","observation_id":"b8e92a28-c075-4055-ad6e-e7d518d18d86","resolution":{"observed_at":"2026-05-21T04:53:58.638862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ntu rgb+ d: A large scale dataset for 3d human activity anal- ysis","venue":null,"work_id":"114c0fb9-6b2e-4b77-9886-a8a9e36d700a","year":2016},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:5b09069270b8cc342a8fe02b1ed0f9a6969312642bfdd73e4e2dccd152d35f73","observation_id":"75295bc4-abb6-4897-90ec-68792ebec72a","resolution":{"observed_at":"2026-05-21T04:53:58.640730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finegym: A hierarchical video dataset for fine-grained action understand- ing","venue":null,"work_id":"be4b842b-6913-4f32-95c3-e5ec993428c9","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:e6294116d06e111512e500bc598df377f1b5e0dce09f58afeffbe5675d485078","observation_id":"52f66faf-fce0-45d8-b18f-4c7cf013f027","resolution":{"observed_at":"2026-05-21T04:53:58.647083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.04134","last_updated":"2020-07-08T14:07:06Z","snapshot_observed_at":"2026-08-11T09:42:40.272479Z","submitted_at":"2020-07-08T14:07:06Z","title":"Learning Speech Representations from Raw Audio by Joint Audiovisual Self-Supervision","version":1},"cited_work":{"arxiv_id":"2007.04134","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.04134","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning speech representations from raw audio by joint audiovisual self-supervision","venue":null,"work_id":"1318a547-6947-4805-8c65-9be59b73c6e8","year":2007},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/2007.04134","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:34619471d5c5dc00741e4e6b394685e3b2923fd5f178c15639e6b70834f40c6d","observation_id":"5df7220e-6658-4b02-8d90-02f339d8fd3e","resolution":{"observed_at":"2026-05-21T04:53:57.819712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Two-stream con- volutional networks for action recognition in videos","venue":null,"work_id":"f33ec2e5-eb18-4dd9-8402-b8027e840454","year":2014},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:f95b27f66152308d5b1daacdc737e15b8ebe14888e96c6cef87c23e0b6e280d6","observation_id":"04450844-ca60-447e-bd35-2ba4e203b489","resolution":{"observed_at":"2026-05-21T04:53:58.634997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":"1212.0402","doi":"10.48550/arxiv.1212.0402","metadata_source":"pith","pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","venue":"cs.CV","work_id":"5dfb46e7-e952-409d-a3c7-ba7f20aebad6","year":2012},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:c0578ffb729d093aa5e68664f2063c38fadf2a0df5790502b370218bea3754de","observation_id":"80fff4f4-3a66-43b4-9f5b-9c3b74af7d78","resolution":{"observed_at":"2026-05-21T04:53:57.811877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05743","last_updated":"2019-09-27T21:59:59Z","snapshot_observed_at":"2026-08-07T11:03:21.673722Z","submitted_at":"2019-06-13T15:03:52Z","title":"Learning Video Representations using Contrastive Bidirectional Transformer","version":2},"cited_work":{"arxiv_id":"1906.05743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1906.05743","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning video representations using contrastive bidirectional transformer.arXiv preprint arXiv:1906.05743","venue":null,"work_id":"34490b65-977c-41a0-8c4f-8f63195b436e","year":1906},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1906.05743","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:acc6ad453d991a28d8ca6059a6a218557ba5a7fe7243dd27f8ab59b49f596d52","observation_id":"8072604e-d5ae-4f54-ba1d-09a61eb1cdea","resolution":{"observed_at":"2026-05-21T04:53:57.803596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08124","last_updated":"2016-09-26T19:14:12Z","snapshot_observed_at":"2026-08-03T14:48:01.874047Z","submitted_at":"2016-09-26T19:14:12Z","title":"Learning Language-Visual Embedding for Movie Understanding with Natural-Language","version":1},"cited_work":{"arxiv_id":"1609.08124","doi":null,"metadata_source":"pith","pith_arxiv_id":"1609.08124","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning Language-Visual Embedding for Movie Understanding with Natural-Language","venue":"cs.CV","work_id":"ce2a0cfa-db2c-474d-9654-0a19f54aebee","year":2016},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/1609.08124","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:ca0146fec6d17021c3eee0b63505620438ca97b7b987efe6a4db616bc80b5901","observation_id":"b7c0138d-73a3-4998-890d-9548560e18b4","resolution":{"observed_at":"2026-05-21T04:53:57.835508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A closer look at spatiotemporal convolutions for action recognition","venue":null,"work_id":"b478a6b9-641d-47a5-a8fd-3a3dc5263582","year":2018},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:ddad54221945b1604aab53628024079c8f1e82aaa061180ef1cc175159feb241","observation_id":"ff7c9ead-7288-4b54-9348-38317db12868","resolution":{"observed_at":"2026-05-21T04:53:58.648140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-supervised spatio-temporal representation learning for videos by predicting motion and appearance statistics","venue":null,"work_id":"ad7e535d-58ac-43e7-a192-bdf9fd89f6e8","year":2019},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:7b647a679b6b595ec5a5389f6f7fd5d8bd4af1264a04d13fe21107968e22e8e2","observation_id":"389ff030-b348-40ae-a58d-8b0d69b86823","resolution":{"observed_at":"2026-05-21T04:53:58.631265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal segment net- works: Towards good practices for deep action recognition","venue":null,"work_id":"32605baf-a5cc-4bc6-83db-6d236e6385f6","year":2016},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:34a7f04a9aede46a5072188751cda1b9ed960de8b1855c7997591206563420b1","observation_id":"5ac333e1-0497-4d85-b378-1594fbe60725","resolution":{"observed_at":"2026-05-21T04:53:58.627503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural multimodal co- operative learning toward micro-video understanding.IEEE Transactions on Image Processing, 29:1–14","venue":null,"work_id":"05f2a4c1-cc7d-4644-ba95-bacd54a4eef4","year":2019},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:589aa84aae86ca3a2649f1107bb7c7a0b8435b556eea0af9806553bb259b0379","observation_id":"dcac19e1-98e6-4886-97be-0216cfd00c47","resolution":{"observed_at":"2026-05-21T04:53:58.625574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-08-09T00:43:35.974628Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":"2001.08740","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-07-03T08:57:47.660611Z","title":"Audiovisual slowfast networks for video recognition.arXiv preprint arXiv:2001.08740","venue":null,"work_id":"3617874f-d8ea-40ca-9b94-f4150287b9f4","year":2001},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:32985cdc29866011db64260d09c6ce54e8431e7432cc692e2bb6dac6db5cdd46","observation_id":"4809551d-1056-40b8-b724-475f4aee7105","resolution":{"observed_at":"2026-05-21T04:53:57.827901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"05d2d00e-941f-4c63-b5cb-8e198126ef59","year":2016},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:9e9c751313de6736f6126f3c9493a326f7ee67a86373a60284c9ac4ace96482a","observation_id":"667d61a2-845a-4d0e-85ca-5a6633b23c2d","resolution":{"observed_at":"2026-05-21T04:53:58.629257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale weakly supervised audio classifi- cation using gated convolutional neural network","venue":null,"work_id":"b9fde876-7876-4fd0-b143-00368d968e92","year":2018},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:9ae724954cf04a1d16eec049e34e772e60603c844f5b4955cd13bdedd5cf7a1e","observation_id":"e466b55e-62a4-4a2b-acba-4179377c47c0","resolution":{"observed_at":"2026-05-21T04:53:58.633120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A joint se- quence fusion model for video question answering and re- trieval","venue":null,"work_id":"74eb4bdb-062f-4956-8dd4-19192487a2a6","year":2018},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:f5acedde2da9d0786d00c7508096c919b763ab448e3e539ec7fb2fcf5fabc93d","observation_id":"2e8bea90-9194-4f5f-a1e5-b6a81620f6cc","resolution":{"observed_at":"2026-05-21T04:53:58.621501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end concept word detection for video caption- ing, retrieval, and question answering","venue":null,"work_id":"b3a7a69a-df96-46d2-a387-7e92f765bf77","year":2017},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:1cead044b4ab350651bf0c64c30f93460940a53ae361d6c7e956a75cf45821b9","observation_id":"87c6bb0a-c7ad-4431-9ff8-b66b21ddad1a","resolution":{"observed_at":"2026-05-21T04:53:58.619548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Low-rank regularized multimodal representation for micro-video event detection.IEEE Access, 8:87266–87274","venue":null,"work_id":"f2af90b1-b2f7-4798-89f9-dd177136903d","year":null},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:94db44408d955a7775d8e73bbb3effee12374b817cdcbe3ee2f530a68c1555cf","observation_id":"3bb22a96-317d-4357-bb02-409880b73cab","resolution":{"observed_at":"2026-05-21T04:53:58.617205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"a0e33de9-7650-4d70-b866-ef40037233cc","year":2018},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:2dc6e62c65d996e7c75fc0b1a8553f2a20abb35b73735b55bc18d04a7446cb55","observation_id":"4b9d62c7-73e9-4a9d-894b-a74c7f7a74af","resolution":{"observed_at":"2026-05-21T04:53:58.623593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videotopic: Content-based video recommendation using a topic model","venue":null,"work_id":"676ec94f-f63d-45e2-9d75-f197f556f7f5","year":2013},"citing_paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-21T04:52:12.045880Z"},"links":{"citing_paper":"/paper/2605.20838"},"observation_digest":"sha256:fc1c0d895ffa67fb605654b66cef11222698c74635d00cee80ac73a0b2f94a2a","observation_id":"b4eb4319-34b4-443e-b17e-00fe44866fbd","resolution":{"observed_at":"2026-05-21T04:53:58.615353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20838","last_updated":"2026-05-20T07:27:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T00:00:48.827421Z","submitted_at":"2026-05-20T07:27:36Z","title":"USV: Towards Understanding the User-generated Short-form Videos"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":6,"verified_exact":18,"verified_fuzzy":55},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2605.20838."}