{"as_of":"2026-08-13T07:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16334c09e1f49a2837d689ad38f7e49bf40fa55b28d68bb4e1c979eee656985d","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:23:20.684103Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:12:23.019873Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T15:13:25.052578Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00526","snapshot_observed_at":"2026-08-08T21:12:23.019873Z","title":"Human action clips: Detecting ai- generated human motion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-10T00:38:45.519768Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:23.019873Z"},"links":{"cited_paper":"/paper/2412.00526","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:571a347c4f6d86604f353b7210381d55fb42721dc4a54011fcb059a88fd30905","observation_id":"d2dd6fc4-7569-4714-bdf3-b51737b727bd","resolution":{"observed_at":"2026-08-08T21:12:23.019873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"cited_work":{"arxiv_id":"2412.00526","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00526","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human action clips: Detecting ai-generated human motion","venue":null,"work_id":"214a1d5c-3b65-4ef5-92c6-d057b580e91c","year":2024},"citing_paper":{"arxiv_id":"2602.04939","last_updated":"2026-05-08T16:47:05Z","snapshot_observed_at":"2026-08-11T16:57:51.461376Z","submitted_at":"2026-02-04T16:47:37Z","title":"SynthForensics: Benchmarking and Evaluating People-Centric Synthetic Video Deepfakes","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T07:32:30.580643Z"},"links":{"cited_paper":"/paper/2412.00526","citing_paper":"/paper/2602.04939"},"observation_digest":"sha256:5866b74e5159ae48970e0fe8efe3eafa4d9a8f89d2b74619e5bfb46e4826ffc7","observation_id":"1fac0a74-999a-4860-9013-1b5e30fddcdd","resolution":{"observed_at":"2026-05-16T07:37:33.016331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"cited_work":{"arxiv_id":"2412.00526","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00526","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human action clips: Detecting ai-generated human motion","venue":null,"work_id":"214a1d5c-3b65-4ef5-92c6-d057b580e91c","year":2024},"citing_paper":{"arxiv_id":"2605.17133","last_updated":"2026-05-16T19:46:33Z","snapshot_observed_at":"2026-08-12T07:10:30.839966Z","submitted_at":"2026-05-16T19:46:33Z","title":"CAM-VFD: Cross-Attention Multimodal Video Forgery Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T15:08:25.309094Z"},"links":{"cited_paper":"/paper/2412.00526","citing_paper":"/paper/2605.17133"},"observation_digest":"sha256:6ddb547eacc7aa6a9c39f9c0b87b445a86785e445097b107ffcb5691541723f6","observation_id":"23b91fb0-a20f-4881-a85c-ab2c1b4876da","resolution":{"observed_at":"2026-05-20T15:13:25.054227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00526/citation-record","integrity":"/paper/2412.00526/integrity","json":"/paper/2412.00526/citation-record.json","paper":"/paper/2412.00526"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.03791","last_updated":"2025-01-25T01:18:23Z","snapshot_observed_at":"2026-08-12T22:31:12.550067Z","submitted_at":"2024-10-03T21:26:58Z","title":"People are poorly equipped to detect AI-powered voice clones","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03791","snapshot_observed_at":"2026-08-12T05:23:20.615674Z","title":"People are poorly equipped to detect AI-powered voice clones","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.615674Z"},"links":{"cited_paper":"/paper/2410.03791","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:dce427fd58339022ac0a8cbcf8224fe954aefc224a872b07fbc9bf375ee12c31","observation_id":"85c9dbce-8aa6-46ec-9002-eca253eaa487","resolution":{"observed_at":"2026-08-12T05:23:20.615674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T05:23:20.620799Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.620799Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:ce10a308bbb7218dfd9d649b8ec2e291f769340bd0fad7bdff16333a8fedf731","observation_id":"9f07d460-e61c-4e4d-bdc7-9dcf7f770f24","resolution":{"observed_at":"2026-08-12T05:23:20.620799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07588","last_updated":"2024-09-08T16:20:11Z","snapshot_observed_at":"2026-08-13T01:32:02.871054Z","submitted_at":"2021-10-14T17:49:42Z","title":"Playing for 3D Human Recovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07588","snapshot_observed_at":"2026-08-12T05:23:20.625984Z","title":"Playing for 3D human recovery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.625984Z"},"links":{"cited_paper":"/paper/2110.07588","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:73f8c13088a11bec4f14d1554ed1be320285c43814e4ac314eab6791a934aebe","observation_id":"ed0b7a9b-2803-4c74-a8e5-10033bf0e925","resolution":{"observed_at":"2026-08-12T05:23:20.625984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-10T09:03:43.940864Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-12T05:23:20.631282Z","title":"PaLI: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.631282Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:206110c079cd3f6af989a5ed0b9e6bd4ab14141a24e6a13058addffb996e145d","observation_id":"fd524c48-284d-4e88-8b0d-6c44be0146b5","resolution":{"observed_at":"2026-08-12T05:23:20.631282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10113","last_updated":"2024-06-03T21:29:28Z","snapshot_observed_at":"2026-08-13T04:39:42.489106Z","submitted_at":"2024-01-18T16:35:37Z","title":"Exposing Lip-syncing Deepfakes from Mouth Inconsistencies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10113","snapshot_observed_at":"2026-08-12T05:23:20.636834Z","title":"Expos- ing lip-syncing deepfakes from mouth inconsistencies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.636834Z"},"links":{"cited_paper":"/paper/2401.10113","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:785a343fc3f620538ab24ac70b091baec87fdaa2a9f6e9e88c9a689b6c7baeb4","observation_id":"9cdfbb66-0a0b-4d1b-a09b-b090c93b4404","resolution":{"observed_at":"2026-08-12T05:23:20.636834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19553","last_updated":"2024-10-23T16:06:32Z","snapshot_observed_at":"2026-08-12T23:13:20.341653Z","submitted_at":"2024-07-28T18:20:08Z","title":"Exploring the Adversarial Robustness of CLIP for AI-generated Image Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19553","snapshot_observed_at":"2026-08-12T05:23:20.641475Z","title":"Exploring the adver- sarial robustness of CLIP for AI-generated image detec- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.641475Z"},"links":{"cited_paper":"/paper/2407.19553","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:ea7d9c4a74aedd915246bcaa7ada5950aded349eb1982a42c495834f22772cf7","observation_id":"b1a2d967-7dcc-487f-a665-7a7c303f991f","resolution":{"observed_at":"2026-08-12T05:23:20.641475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-12T05:23:20.646151Z","title":"VideoPoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.646151Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:6d1d1aa9bd101d0902b29d3329e8dfa15578af93472935efa09c3e93c7289ebb","observation_id":"6442f9c9-2048-40d6-9bda-349bc54598f1","resolution":{"observed_at":"2026-08-12T05:23:20.646151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12706","last_updated":"2024-03-19T13:08:54Z","snapshot_observed_at":"2026-08-13T00:50:22.589007Z","submitted_at":"2024-03-19T13:08:54Z","title":"AnimateDiff-Lightning: Cross-Model Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12706","snapshot_observed_at":"2026-08-12T05:23:20.655486Z","title":"AnimateDiff-Lightning: Cross-model diffusion distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.655486Z"},"links":{"cited_paper":"/paper/2403.12706","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:c6c039bd2375152dcadb14cda9eceb85702566a9a7ef2c265e60d62514e22b54","observation_id":"71d4e8e1-5848-4744-aeb1-65df39c7d66b","resolution":{"observed_at":"2026-08-12T05:23:20.655486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08849","last_updated":"2024-12-10T15:35:31Z","snapshot_observed_at":"2026-08-12T22:46:03.233054Z","submitted_at":"2024-09-12T17:59:08Z","title":"DeCLIP: Decoding CLIP representations for deepfake localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08849","snapshot_observed_at":"2026-08-12T05:23:20.670086Z","title":"DeCLIP: Decoding CLIP representations for deepfake localization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.670086Z"},"links":{"cited_paper":"/paper/2409.08849","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:777c18667ff2fe46b11bf36defbb5d758978d7ae00c7bfd3c62c884d2599be9e","observation_id":"1f938311-0eef-4ee4-86e1-db65f2fa704b","resolution":{"observed_at":"2026-08-12T05:23:20.670086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07190","last_updated":"2022-03-14T15:29:27Z","snapshot_observed_at":"2026-08-11T23:32:35.888993Z","submitted_at":"2022-03-14T15:29:27Z","title":"CLIP Models are Few-shot Learners: Empirical Studies on VQA and Visual Entailment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07190","snapshot_observed_at":"2026-08-12T05:23:20.674694Z","title":"CLIP models are few-shot learners: Empirical studies on vqa and visual entailment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.674694Z"},"links":{"cited_paper":"/paper/2203.07190","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:b4bac256f05d70305d2abf415358f87700bc4cce2d35d736a30668220c27be5c","observation_id":"15b8295a-9ff7-47af-bd7f-be6e5e19c222","resolution":{"observed_at":"2026-08-12T05:23:20.674694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07472","last_updated":"2024-11-20T01:32:48Z","snapshot_observed_at":"2026-08-12T23:45:20.258560Z","submitted_at":"2024-06-11T17:19:26Z","title":"4Real: Towards Photorealistic 4D Scene Generation via Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07472","snapshot_observed_at":"2026-08-12T05:23:20.684103Z","title":"4Real: Towards photo- realistic 4D scene generation via video diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.684103Z"},"links":{"cited_paper":"/paper/2406.07472","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:e1642ca75f64037041fc01cf3bb2f292932d8636c3adee4c02ddc4092999aaf3","observation_id":"6e7baf02-b2af-48f4-8b46-e556881897fa","resolution":{"observed_at":"2026-08-12T05:23:20.684103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-12T05:23:20.679515Z","title":"CogVideoX: Text- to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.679515Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:8c4482a5386a503519f8b6198c53ce3a0790fd41a9937c46ae8abefd8ddc100e","observation_id":"81aa69e6-e2e5-4fa3-baf2-59251b8623b2","resolution":{"observed_at":"2026-08-12T05:23:20.679515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-13T00:13:12.479004Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-12T05:23:20.604699Z","title":"Vidu: A highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.604699Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:175f4c74ae3af0158c3da9d85db36fd7e1e86de3decedb0dbf34ce3a48dafb91","observation_id":"2931710b-9f08-4443-9809-b6230cff4857","resolution":{"observed_at":"2026-08-12T05:23:20.604699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-12T05:23:20.660085Z","title":"LAION- 400M: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.660085Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:5615092406c577d1cee3eea3afa2c9776e78523c22142c5d6613c25c70d121d7","observation_id":"0de5dad8-3326-4922-b73d-f82e5443a8b0","resolution":{"observed_at":"2026-08-12T05:23:20.660085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-12T05:23:20.665056Z","title":"How much can CLIP benefit vision-and-language tasks? arXiv:2107.06383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.665056Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:b5cd256519155439a67f3e7a068b42369273b3c36a1579de8a58c29a3abdde14","observation_id":"d0fa75b4-7dfa-451b-bcfd-ee04f69247cc","resolution":{"observed_at":"2026-08-12T05:23:20.665056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-08-12T23:54:01.626288Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-12T05:23:20.650879Z","title":"Jina CLIP: Your CLIP model is also your text retriever","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.650879Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:cbf1407ee501acb6ae34db4623342df915d804f345f78c7d81469e27109efacc","observation_id":"3997a9ce-1f6b-45bc-a7c4-e62e457061ee","resolution":{"observed_at":"2026-08-12T05:23:20.650879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-13T04:36:44.594755Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-12T05:23:20.610451Z","title":"Lu- miere: A space-time diffusion model for video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.610451Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:cc0323d19bb57a665f4bb960628b3dfa65f8d7c3073f64286341bafc07f7c83c","observation_id":"993eeb03-e35c-4bb5-8cb1-4e4ccf310ffc","resolution":{"observed_at":"2026-08-12T05:23:20.610451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T02:51:30.376850Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 3 inbound Pith citation observations for arXiv:2412.00526."}