{"as_of":"2026-08-18T05:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb4b30caeb8280b83056d29e24a59f64eeef1ad5dd1d23dc7544fed7385536ba","coverage":[{"denominator":294,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:18:39.408235Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:22:55.579720Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T10:29:46.922814Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17847","snapshot_observed_at":"2026-08-16T05:22:55.579720Z","title":"Bridging the data provenance gap across text, speech and video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20879","last_updated":"2025-05-12T16:33:58Z","snapshot_observed_at":"2026-08-17T00:43:37.683523Z","submitted_at":"2025-04-29T15:48:49Z","title":"The Leaderboard Illusion","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T05:22:55.579720Z"},"links":{"cited_paper":"/paper/2412.17847","citing_paper":"/paper/2504.20879"},"observation_digest":"sha256:1172aae9df88723fe7e0a7bdc55b26cde4bfd0cb7a555b56a08962c406de5aff","observation_id":"2ea33814-c125-4f59-b3eb-30b7ab1d5d0f","resolution":{"observed_at":"2026-08-16T05:22:55.579720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17847","snapshot_observed_at":"2026-08-07T14:42:06.940110Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17841","last_updated":"2025-05-23T12:55:33Z","snapshot_observed_at":"2026-08-14T05:05:44.596019Z","submitted_at":"2025-05-23T12:55:33Z","title":"TEDI: Trustworthy and Ethical Dataset Indicators to Analyze and Compare Dataset Documentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:06.940110Z"},"links":{"cited_paper":"/paper/2412.17847","citing_paper":"/paper/2505.17841"},"observation_digest":"sha256:bca7f817446205969a4cf7a11803badf5382acd5cba475c176abf8566eb10509","observation_id":"a93a6730-803a-4979-8f1e-eeefa0299a95","resolution":{"observed_at":"2026-08-07T14:42:06.940110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"cited_work":{"arxiv_id":"2412.17847","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.17847","snapshot_observed_at":"2026-08-07T10:29:46.922814Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","venue":"cs.AI","work_id":"faedd1c6-66ef-4212-b4ae-3cf12936728f","year":2024},"citing_paper":{"arxiv_id":"2506.05209","last_updated":"2025-06-05T16:21:30Z","snapshot_observed_at":"2026-08-09T07:25:20.673180Z","submitted_at":"2025-06-05T16:21:30Z","title":"The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:44.548165Z"},"links":{"cited_paper":"/paper/2412.17847","citing_paper":"/paper/2506.05209"},"observation_digest":"sha256:2f49bee1145a89413febd505c3209c9a66cdbb049ac5f779b16b6de45b8acdbc","observation_id":"f731eed2-b730-4270-841a-088f1f5382dd","resolution":{"observed_at":"2026-08-07T10:29:46.930466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17847","snapshot_observed_at":"2026-08-04T19:58:54.302390Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08960","last_updated":"2025-09-10T19:47:46Z","snapshot_observed_at":"2026-08-17T14:48:22.075863Z","submitted_at":"2025-09-10T19:47:46Z","title":"BRoverbs -- Measuring how much LLMs understand Portuguese proverbs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T19:58:54.302390Z"},"links":{"cited_paper":"/paper/2412.17847","citing_paper":"/paper/2509.08960"},"observation_digest":"sha256:319b9d7fa7412d79d1daa92020f7fecaacb471666dfdf9e0ed11d516d2fa59c6","observation_id":"ba0306ed-e07e-42f3-bcf8-09d27c104048","resolution":{"observed_at":"2026-08-04T19:58:54.302390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17847/citation-record","integrity":"/paper/2412.17847/integrity","json":"/paper/2412.17847/citation-record.json","paper":"/paper/2412.17847"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.126845Z","title":"Untitled review,","venue":null,"work_id":null,"year":1914},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.126845Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:17e5839c24e32e23305d1afd3f5411d07c9185f88130202ac2e4512fd7eda3d9","observation_id":"4d2e697d-9363-4731-9070-bf871ededd9e","resolution":{"observed_at":"2026-08-11T12:18:37.126845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.134025Z","title":"On the measurement of inequality,","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.134025Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:b65b52b37ea6a5846854c04610dc113623c65f3be7f929a022d6b1bd2e28019d","observation_id":"35b7cf81-d240-4fbd-ada6-a818d742b7b9","resolution":{"observed_at":"2026-08-11T12:18:37.134025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.cviu.2013.01.013","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:43.906958Z","title":"A survey of video datasets for human action and activity recognition,","venue":null,"work_id":"a654c88e-153f-44c7-8646-95e122de16ee","year":2013},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.139721Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:8676ecb315511e07c26f2d321b994ae76c65485a697a3cf0c5dfff2978301410","observation_id":"e2282deb-125e-45b2-882f-16665140cebb","resolution":{"observed_at":"2026-08-11T12:18:43.954046Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08536","last_updated":"2017-11-22T23:56:37Z","snapshot_observed_at":"2026-08-14T20:10:52.669440Z","submitted_at":"2017-11-22T23:56:37Z","title":"No Classification without Representation: Assessing Geodiversity Issues in Open Data Sets for the Developing World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.08536","snapshot_observed_at":"2026-08-11T12:18:37.431142Z","title":"No classification without representation: Assessing geodiversity issues in open data sets for the developing world,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.431142Z"},"links":{"cited_paper":"/paper/1711.08536","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:a00a65bc07c5e7dd0a7dd47d4a1c3e4cc165891b18179ad65fd0b4aee0d11802","observation_id":"451848a5-994d-49c4-9fff-d7657153b0eb","resolution":{"observed_at":"2026-08-11T12:18:37.431142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.435498Z","title":"Playing hard exploration games by watching youtube,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.435498Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:38f6cf83912628241882196d94302d11feda0cf957d349d65b146b38f7c3123e","observation_id":"e33bdddd-86c1-47be-b88e-69b800095733","resolution":{"observed_at":"2026-08-11T12:18:37.435498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.439558Z","title":"Data statements for natural language processing: Toward mitigating system bias and enabling better science,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.439558Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:5d162f853dd1e78e737b52e2071bb7008c549e80ab75d6dbaecae91d3a175ed0","observation_id":"bb59c224-4697-4f53-8ab6-5172831b101f","resolution":{"observed_at":"2026-08-11T12:18:37.439558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.449771Z","title":"Gender shades: Intersectional accuracy disparities in commer- cial gender classification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.449771Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:d736ae747661b8408b4b27ad5f62a6239262c0c5bae891f9226e59f595a802ff","observation_id":"ffe633ed-dd3b-45da-b569-e1fad83c52ea","resolution":{"observed_at":"2026-08-11T12:18:37.449771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-11T12:18:37.455322Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.455322Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:0f62ee6ad605cef7ed7d7a9b2b84776f68f022db4159a5890bd1f120bb412ab9","observation_id":"4bad7737-d010-4bdb-8af7-b4f872455d9b","resolution":{"observed_at":"2026-08-11T12:18:37.455322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.460876Z","title":"Does object recognition work for everyone?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.460876Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:39dffe9bf1d47fc1c5a9c6fb558ff8546e8dc7a250933ff7bb538c30247f76ed","observation_id":"1c45452e-f139-45a0-bf04-d93d8c0f3bd4","resolution":{"observed_at":"2026-08-11T12:18:37.460876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.465688Z","title":"Visual to text: Survey of image and video captioning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.465688Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:7d3e8ef2512f6a257690f5c82a5738a93ed991930d1bdd49281407206b34ee78","observation_id":"5ff71237-162e-436d-9b39-b03f1d114e73","resolution":{"observed_at":"2026-08-11T12:18:37.465688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.475425Z","title":"Mundane content on social media: Creation, circulation, and the copyright problem,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.475425Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:99c35d21c46ce10b3c5c29c41fd0ecb28ad52808bafcce73d72e25820a17f594","observation_id":"f35a663c-9573-485b-9e10-9abecab58c56","resolution":{"observed_at":"2026-08-11T12:18:37.475425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.480576Z","title":"Model cards for model reporting,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.480576Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:9252663db424d025f21eceabd9920ddb9039f444c40496757a9ae0dfd5c364f9","observation_id":"1fc08473-de3a-4765-ac48-f08e88e3bc29","resolution":{"observed_at":"2026-08-11T12:18:37.480576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.485834Z","title":"Moments in time dataset: One million videos for event understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.485834Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:57417a01ca3fc48f01d3371ec7fada8d705d5a40cb43534fe5aed732c8276ac9","observation_id":"344370fa-0a08-4f67-b9e7-9e12a29c9f31","resolution":{"observed_at":"2026-08-11T12:18:37.485834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.490744Z","title":"Social data: Biases, methodological pitfalls, and ethical boundaries,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.490744Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:7aa8b6f7e50f32675010af2b21912eda9999487f38a9ea19c92e2411b0824e64","observation_id":"1e5c51d5-f155-4514-8a01-f5e99c5516ff","resolution":{"observed_at":"2026-08-11T12:18:37.490744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.495107Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.495107Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:8dbeaa7d077d015167e12451666b74ed09e35a3f5ae5649051ca238d88b03f04","observation_id":"3946237d-fc0f-40da-b651-d5dfc4a3a7a2","resolution":{"observed_at":"2026-08-11T12:18:37.495107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.499991Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.499991Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:29b723e3a0a8134628ba4e11c0771440c689a827d188f75a613fdb820ab4ec6a","observation_id":"b88d587a-ed5b-44b9-ba0a-88b339426238","resolution":{"observed_at":"2026-08-11T12:18:37.499991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.504919Z","title":"Semantic visual navigation by watching youtube videos,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.504919Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:5e5fde9ce1a7ccfe394aabed0a89f6e85c623e02b5d256f7c487deaf13e861d4","observation_id":"a6dac15b-1494-4175-8e2c-69d289565a6f","resolution":{"observed_at":"2026-08-11T12:18:37.504919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-11T12:18:37.680509Z","title":"The pile: An 800gb dataset of diverse text for language modeling,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.680509Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:ca88bde341989f46a0ceef205b5719b05439e16e281b5fe151e5db7afe1694b1","observation_id":"ce6f8933-2302-4e48-b68f-0f587ae271c6","resolution":{"observed_at":"2026-08-11T12:18:37.680509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.779146Z","title":"Henighan, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.779146Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:4a4bea2c7302d9405ba564e40c9f5af8f357ae86d6f0bf143bbef50276c04998","observation_id":"c30bb912-7912-4b60-b6fe-6fba66ac48df","resolution":{"observed_at":"2026-08-11T12:18:37.779146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09095","last_updated":"2021-01-27T03:39:20Z","snapshot_observed_at":"2026-08-13T18:05:31.114488Z","submitted_at":"2020-04-20T07:19:22Z","title":"The State and Fate of Linguistic Diversity and Inclusion in the NLP World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09095","snapshot_observed_at":"2026-08-11T12:18:37.791548Z","title":"The state and fate of linguistic diversity and inclusion in the nlp world,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.791548Z"},"links":{"cited_paper":"/paper/2004.09095","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:655c6356388cb89e90c6972636f1091841a81ea4bd76ef15ea8b6b27734f2920","observation_id":"0c752b47-712b-423e-b07d-ea61403fc7af","resolution":{"observed_at":"2026-08-11T12:18:37.791548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T12:18:37.797181Z","title":"Scaling laws for neural language models,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.797181Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:da5100bd4763239c03d9fc69c5191c5d750509bd3296dfcb06b43828c5f79a50","observation_id":"74dbc32e-d3be-4898-bfd6-fa3f21ed6852","resolution":{"observed_at":"2026-08-11T12:18:37.797181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00085","last_updated":"2020-04-30T20:21:02Z","snapshot_observed_at":"2026-08-18T02:33:19.767735Z","submitted_at":"2020-04-30T20:21:02Z","title":"AI4Bharat-IndicNLP Corpus: Monolingual Corpora and Word Embeddings for Indic Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00085","snapshot_observed_at":"2026-08-11T12:18:37.801569Z","title":"Ai4bharat-indicnlp corpus: Monolingual corpora and word embeddings for indic languages,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.801569Z"},"links":{"cited_paper":"/paper/2005.00085","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:6ceb3771d90e502279ce4a563338a6c3e3b6ffa996dc18f3fd4e167f0b23c91e","observation_id":"5d6e7218-edcc-455c-891e-f25bd84cb20a","resolution":{"observed_at":"2026-08-11T12:18:37.801569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.806778Z","title":"Beyond “i agree","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.806778Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:b2e9f60c05ffb2861256f5ba9ca3489c49d61473e12199a2ad5adf4e5b5d36e0","observation_id":"b6405bc6-1edc-4336-8eb5-d9bdd853938c","resolution":{"observed_at":"2026-08-11T12:18:37.806778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.811826Z","title":"The new legal landscape for text mining and machine learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.811826Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:91779651f985f2ccc7aa54230818f35c50834d8bead5b078c18a7aea09e9507a","observation_id":"f8998262-70d3-47b0-8c23-cd235167b500","resolution":{"observed_at":"2026-08-11T12:18:37.811826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06567","last_updated":"2020-12-11T18:54:08Z","snapshot_observed_at":"2026-08-17T13:19:55.906101Z","submitted_at":"2020-12-11T18:54:08Z","title":"A Comprehensive Study of Deep Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.06567","snapshot_observed_at":"2026-08-11T12:18:37.818453Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.818453Z"},"links":{"cited_paper":"/paper/2012.06567","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:c9c07299e09a4b99be357327f7d244ca73865d601095749840131c81b9678067","observation_id":"2d69d7a3-54c0-452e-a900-87ece0af7b7f","resolution":{"observed_at":"2026-08-11T12:18:37.818453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:37.823677Z","title":"Masakhaner: Named entity recognition for african languages,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.823677Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:7c9ee5e71c338e0bac74aa97c78c44b6b8686e151ee2e5295493ff294e9e8fc2","observation_id":"f66b7838-838b-40fe-a4b6-321720bcc393","resolution":{"observed_at":"2026-08-11T12:18:37.823677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.bppf-1.4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:43.800256Z","title":"How might we create better benchmarks for speech recognition?","venue":null,"work_id":"7094810c-e0d4-440b-995d-c46711435edd","year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.828242Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:55aaddc6937d1d675b5b070e53b35c1342a30aeab85c4d1981dd2b93f96b4bcc","observation_id":"893e0746-134a-4274-b4b5-0297d839abf1","resolution":{"observed_at":"2026-08-11T12:18:43.839640Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-08-16T17:41:05.963766Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-11T12:18:37.833298Z","title":"Xls-r: Self-supervised cross-lingual speech representa- tion learning at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.833298Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:0994f77c1405a1c342013b322e901bc9dc539c9447da87de269d22e460b7aebf","observation_id":"dc9a17e6-7fc7-4c7d-a0bd-87032b8376a0","resolution":{"observed_at":"2026-08-11T12:18:37.833298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05241","last_updated":"2021-05-11T17:59:23Z","snapshot_observed_at":"2026-08-16T18:25:26.984008Z","submitted_at":"2021-05-11T17:59:23Z","title":"Addressing \"Documentation Debt\" in Machine Learning Research: A Retrospective Datasheet for BookCorpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.05241","snapshot_observed_at":"2026-08-11T12:18:37.869550Z","title":"Addressing “documentation debt","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.869550Z"},"links":{"cited_paper":"/paper/2105.05241","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:19eb27038f28e1b7ef1b3494ec5c5679dd05294f0b8c4d40f517f1b0ebe88a65","observation_id":"b110d844-2909-4230-986f-87078a386f56","resolution":{"observed_at":"2026-08-11T12:18:37.869550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.01963","last_updated":"2021-10-05T11:47:27Z","snapshot_observed_at":"2026-08-17T20:03:41.214987Z","submitted_at":"2021-10-05T11:47:27Z","title":"Multimodal datasets: misogyny, pornography, and malignant stereotypes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.01963","snapshot_observed_at":"2026-08-11T12:18:37.938469Z","title":"Multimodal datasets: Misogyny, pornography, and malignant stereotypes,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:37.938469Z"},"links":{"cited_paper":"/paper/2110.01963","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:e62e78c55bdce65c499be6d2c4c8c1acb7c11f8af74bc348781b4bbf7f50d24c","observation_id":"12001a36-45c2-481e-ba93-b4a44767bdbd","resolution":{"observed_at":"2026-08-11T12:18:37.938469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.12028","last_updated":"2022-02-21T16:41:38Z","snapshot_observed_at":"2026-08-16T18:37:12.375625Z","submitted_at":"2021-03-22T17:30:33Z","title":"Quality at a Glance: An Audit of Web-Crawled Multilingual Datasets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.12028","snapshot_observed_at":"2026-08-11T12:18:38.016129Z","title":"Quality at a glance: An audit of web-crawled multilingual datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.016129Z"},"links":{"cited_paper":"/paper/2103.12028","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:99652635e52d031132f27364f0e2684101e2e7ade6da3e43a318c9f4f26303ed","observation_id":"37cc4280-6d2c-41bd-b2a2-2ca514b35e48","resolution":{"observed_at":"2026-08-11T12:18:38.016129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.021819Z","title":"Documenting large webtext corpora: A case study on the colossal clean crawled corpus,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.021819Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:bf7530b0bc753c6afe7d6dd77186a34287ddd3da91ecfadb840420e773a78b4b","observation_id":"f7eaaa3e-eb0a-40ca-8030-aea1d999d7f2","resolution":{"observed_at":"2026-08-11T12:18:38.021819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T12:18:38.026230Z","title":"Dosovitskiy, L","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.026230Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:ae0c1d7b363bb2ef696af92b3e33f058cfa6ee147e9f92e5e6520d9cf1a2ac99","observation_id":"b194b82b-4595-4f52-8e28-41de7c5e4670","resolution":{"observed_at":"2026-08-11T12:18:38.026230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.031666Z","title":"Datasheets for datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.031666Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:cb1f0c09d02f083a745820c5dccbfd9be8cef697e4f512aa82e29a71d53bc396","observation_id":"cedb07ac-4798-4960-8d60-e70b1e5b5d63","resolution":{"observed_at":"2026-08-11T12:18:38.031666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.02732","last_updated":"2021-05-31T20:39:54Z","snapshot_observed_at":"2026-08-16T18:26:34.607503Z","submitted_at":"2021-05-06T14:49:43Z","title":"What's in the Box? A Preliminary Analysis of Undesirable Content in the Common Crawl Corpus","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.02732","snapshot_observed_at":"2026-08-11T12:18:38.036804Z","title":"What’s in the box? a preliminary analysis of undesirable content in the common crawl corpus,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.036804Z"},"links":{"cited_paper":"/paper/2105.02732","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:2371919c967dafe5cea2a13ba0729a99d6a7022b4bfee1e3c40507ccce59f76b","observation_id":"5a7a7463-4d51-46a6-b8b1-c9a9dd798a04","resolution":{"observed_at":"2026-08-11T12:18:38.036804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09211","last_updated":"2021-07-20T01:05:31Z","snapshot_observed_at":"2026-08-16T18:08:55.867604Z","submitted_at":"2021-07-20T01:05:31Z","title":"Understanding Gender and Racial Disparities in Image Recognition Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09211","snapshot_observed_at":"2026-08-11T12:18:38.041579Z","title":"Understanding gender and racial disparities in image recognition models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.041579Z"},"links":{"cited_paper":"/paper/2107.09211","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:384d2e9343ffbb3eaf1497625a34cfb0cc306e11784c498b1ced19cb97a85bf2","observation_id":"8be59f2d-bd70-4abc-b42d-9b35b1ab51e4","resolution":{"observed_at":"2026-08-11T12:18:38.041579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.047296Z","title":"Automatic speech recognition: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.047296Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:50157387b17682537ab7b6ad793f0f4351a1e2a3786b55fb876f27a8bd547f9e","observation_id":"7370843e-9c09-490f-b391-7a6650342d81","resolution":{"observed_at":"2026-08-11T12:18:38.047296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04489","last_updated":"2021-05-10T16:30:46Z","snapshot_observed_at":"2026-08-16T18:25:48.882470Z","submitted_at":"2021-05-10T16:30:46Z","title":"Spoken Moments: Learning Joint Audio-Visual Representations from Video Descriptions","version":1},"cited_work":{"arxiv_id":"2105.04489","doi":"10.48550/arxiv.2105.04489","metadata_source":"pith","pith_arxiv_id":"2105.04489","snapshot_observed_at":"2026-08-11T18:16:15.004306Z","title":"Spoken Moments: Learning Joint Audio-Visual Representations from Video Descriptions","venue":"cs.CV","work_id":"671804b0-9d42-4092-8812-0ace805e0dda","year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.051968Z"},"links":{"cited_paper":"/paper/2105.04489","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:04a5b66944d1001ae19644b14b3e3fc4b97909ffa21d91d86285362536c46152","observation_id":"037abbb7-10d4-4be6-a9f4-41c338d56874","resolution":{"observed_at":"2026-08-11T12:18:43.759925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.057796Z","title":"Data and its (dis) contents: A survey of dataset development and use in machine learning research,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.057796Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:7eb08835ee7fed43c58c6443f3c697d43b9e2483895588c54597650e4136bf3a","observation_id":"6acb6b60-e698-4cc1-aa47-1a6b478bff4b","resolution":{"observed_at":"2026-08-11T12:18:38.057796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-11T12:18:38.062678Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.062678Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:0fc1cfad4bd486d593878c4336ce626af1ee6ccf71920080fd67036e5024ce10","observation_id":"5e73f1e9-ceb0-42db-b2ca-6c2dedee9f3e","resolution":{"observed_at":"2026-08-11T12:18:38.062678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.068300Z","title":"Changing the world by changing the data,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.068300Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:3caa0419fe142ef7afbfa29bce0a4248db7988a554d26d77b8ee839f254327fa","observation_id":"c9e0dc0a-1865-4c99-91b1-2d059aa0d449","resolution":{"observed_at":"2026-08-11T12:18:38.068300Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.072970Z","title":"“Everyone wants to do the model work, not the data work","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.072970Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:e84dc36d412733a21c63990e68e96c906f2c2429dd69ead67c7e8719baa646ea","observation_id":"cc104248-65a2-4751-853e-28500ea7957b","resolution":{"observed_at":"2026-08-11T12:18:38.072970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-08-14T04:21:28.978034Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-11T12:18:38.077796Z","title":"Multitask prompted training enables zero-shot task generalization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.077796Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:daec4c56f13651a80a5fa87513c21fec4e8fcabeed363abc6f9b0bce41ca5236","observation_id":"daded205-9e1e-489b-871a-2538c80fa3e7","resolution":{"observed_at":"2026-08-11T12:18:38.077796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.099319Z","title":"Finetuned language models are zero-shot learners,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.099319Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:52f0341745054eb0af61eb1d877088084647524b5192493b9af2294c813c9854","observation_id":"19c4b6b2-b8c7-4325-8ed4-009c3e3e5a45","resolution":{"observed_at":"2026-08-11T12:18:38.099319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.203075Z","title":"Challenges in detoxifying language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.203075Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:8f3a2eafc95f8d811cbde3564a894030e57f9e1b367624eca29c55f094257d4e","observation_id":"39a725a8-afcb-408c-b5ad-3d565b4afd2d","resolution":{"observed_at":"2026-08-11T12:18:38.203075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.301572Z","title":"Detoxifying language models risks marginalizing minority voices,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.301572Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:6de5afaeb97c7f48261479ababfbb310c05d2c876615510f23798d70f7ea94f1","observation_id":"c076c99c-161f-476b-bf7a-2bacfa00ff6b","resolution":{"observed_at":"2026-08-11T12:18:38.301572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.374350Z","title":"Masader: Metadata sourcing for arabic text and speech data resources,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.374350Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:73004077d2311ab5780f92c8bc4f16077a90cb2e4b7fc19dd1f2caa37f7874cf","observation_id":"eef597fb-cc84-4f52-991d-9ca45741d2c1","resolution":{"observed_at":"2026-08-11T12:18:38.374350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07646","last_updated":"2023-03-06T06:28:18Z","snapshot_observed_at":"2026-08-15T14:36:26.439846Z","submitted_at":"2022-02-15T18:48:31Z","title":"Quantifying Memorization Across Neural Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07646","snapshot_observed_at":"2026-08-11T12:18:38.379014Z","title":"Quantifying memo- rization across neural language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.379014Z"},"links":{"cited_paper":"/paper/2202.07646","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:0f087f6ed4613e7cffdf0c208a2df420e3927590a395a95de71ad35d7fd48028","observation_id":"cba3522f-5ce5-4a0f-a0c3-9477e0333ea7","resolution":{"observed_at":"2026-08-11T12:18:38.379014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04769","last_updated":"2022-06-09T21:16:10Z","snapshot_observed_at":"2026-08-16T16:54:03.233760Z","submitted_at":"2022-06-09T21:16:10Z","title":"CLAP: Learning Audio Concepts From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04769","snapshot_observed_at":"2026-08-11T12:18:38.384193Z","title":"Elizalde, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.384193Z"},"links":{"cited_paper":"/paper/2206.04769","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:093d808ee6322a4331309ff309c0752de1d9d4cc305c342a0504d4b97d36bc9e","observation_id":"b615bad5-4b4a-4209-84a0-bee73cb7cbea","resolution":{"observed_at":"2026-08-11T12:18:38.384193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.388736Z","title":"Dataset geography: Mapping language data to language users,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.388736Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:15c2c12148950bb01732e61ed62d60043fbc3bc5be42284d4082326128dd499e","observation_id":"c584ab02-e0d1-475b-84d3-fa4ffcd9b150","resolution":{"observed_at":"2026-08-11T12:18:38.388736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.392967Z","title":"The flores-101 evaluation benchmark for low- resource and multilingual machine translation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.392967Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:42df1186bf7666116fb1830cd7c02fb4ed13ba2d45c04a7accd6d397b4926b73","observation_id":"b2401b8d-e086-47c9-a2ce-876bd273dec2","resolution":{"observed_at":"2026-08-11T12:18:38.392967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-11T12:18:38.396913Z","title":"Training compute-optimal large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.396913Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:40fee8ab57f06aa3bdafb69717def8b7195a469c5ac8a316f87395ee89b4b5d3","observation_id":"764ed178-a112-4e73-b527-f671461daa62","resolution":{"observed_at":"2026-08-11T12:18:38.396913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07048","last_updated":"2022-07-14T16:44:59Z","snapshot_observed_at":"2026-08-16T16:45:55.047802Z","submitted_at":"2022-07-14T16:44:59Z","title":"Leakage and the Reproducibility Crisis in ML-based Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07048","snapshot_observed_at":"2026-08-11T12:18:38.401723Z","title":"Leakage and the reproducibility crisis in ml-based science,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.401723Z"},"links":{"cited_paper":"/paper/2207.07048","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:91172eb7dbf31ae8eff0c4ded90c149a0a059f50b3b22a8cc7cb037c59ae4c24","observation_id":"ba5e3d54-2a89-4a45-a117-3b53c3249014","resolution":{"observed_at":"2026-08-11T12:18:38.401723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.406325Z","title":"Quality at a glance: An audit of web-crawled multilingual datasets,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.406325Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:eacea46f50f799443eea1fe37224b2fbfa4ff10dcadf185580549d5e87ecf3b5","observation_id":"0c506884-047f-4cca-9a0c-7812bb72e2b1","resolution":{"observed_at":"2026-08-11T12:18:38.406325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.411146Z","title":"The bigscience roots corpus: A 1.6tb composite multilingual dataset,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.411146Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:bd855967dac0be57352c1bdd94801a8380de126ae3c72a29bf61941b26dc8763","observation_id":"8ce539a6-b5a1-45b2-b993-7ce4b9130ac2","resolution":{"observed_at":"2026-08-11T12:18:38.411146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.415788Z","title":"McMillan-Major, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.415788Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:a8acbf6a3bcc0d049f7fec3123fc31cc4bd8939277a0f890e39d8db2a1b3214c","observation_id":"baf44963-345d-440f-b9a3-a1ed92b6e504","resolution":{"observed_at":"2026-08-11T12:18:38.415788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10066","last_updated":"2022-01-25T03:05:23Z","snapshot_observed_at":"2026-08-16T17:26:13.720502Z","submitted_at":"2022-01-25T03:05:23Z","title":"Documenting Geographically and Contextually Diverse Data Sources: The BigScience Catalogue of Language Data and Resources","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.10066","snapshot_observed_at":"2026-08-11T12:18:38.425838Z","title":"Documenting geographically and contextually diverse data sources: The bigscience catalogue of language data and resources,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.425838Z"},"links":{"cited_paper":"/paper/2201.10066","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:611a8ff5558eb1a4a7e4d667472a81308e7f6375c1905055b40bed15f36dcd23","observation_id":"4ff7621d-871e-4d76-bf55-ada84cf18fe6","resolution":{"observed_at":"2026-08-11T12:18:38.425838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05976","last_updated":"2022-04-13T16:13:43Z","snapshot_observed_at":"2026-08-16T17:07:23.495887Z","submitted_at":"2022-04-12T17:42:53Z","title":"Video Captioning: a comparative review of where we are and which could be the route","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05976","snapshot_observed_at":"2026-08-11T12:18:38.430624Z","title":"Moctezuma, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.430624Z"},"links":{"cited_paper":"/paper/2204.05976","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:c6c8cc18d6e4f2b771e4eb21250d1bfa07343b4efe7a7e4914cc937bdaf9a4bb","observation_id":"203b6d24-b31f-4bad-bd5c-3ae18f6ccb3e","resolution":{"observed_at":"2026-08-11T12:18:38.430624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-11T12:18:38.435910Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.435910Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:e51b17e45cf9d5d48c2c30592fae4f2334a48c9152d2ebf1119ac2d1d764bfad","observation_id":"ece03659-e309-47c9-bd25-9187a2f22a40","resolution":{"observed_at":"2026-08-11T12:18:38.435910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T12:18:38.441839Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.441839Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:db164709da5a060999e9d741bd25b433bafba0dc0ffbe95b0f6df2789573c5ab","observation_id":"eeb9ff7f-ebfb-4a92-b1c9-59ba47d99210","resolution":{"observed_at":"2026-08-11T12:18:38.441839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04610","last_updated":"2022-11-10T10:07:37Z","snapshot_observed_at":"2026-08-16T16:27:19.710410Z","submitted_at":"2022-10-03T14:04:46Z","title":"Red-Teaming the Stable Diffusion Safety Filter","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04610","snapshot_observed_at":"2026-08-11T12:18:38.446393Z","title":"Rando, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.446393Z"},"links":{"cited_paper":"/paper/2210.04610","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:da23ec2ac18a4672b84a3470f516a1813be58b46b9d7961dbc3cfd2545adbd4d","observation_id":"bfcda661-d96c-45b1-8a7c-9f9e218c7b27","resolution":{"observed_at":"2026-08-11T12:18:38.446393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T12:18:38.451457Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.451457Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:556046f69331c491cfe5fc9fcac03d75128c1a38783cbcdde0761a4e03c42631","observation_id":"620b7cc8-ab03-427c-8fb9-dc438dc81a84","resolution":{"observed_at":"2026-08-11T12:18:38.451457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.455743Z","title":"Bigssl: Exploring the frontier of large-scale semi- supervised learning for automatic speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.455743Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:b824c8a4ae9335f6f9864d3585670d31808804e99fbe11a67e29f8f66b7df16c","observation_id":"b04f1218-2a03-428d-aee9-26b3fed62131","resolution":{"observed_at":"2026-08-11T12:18:38.455743Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.550049Z","title":"Survey of video object detection algorithms based on deep learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.550049Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:4d3cc8680380972fc23a2fc4f43a32ba8d4c4d9dd9cfa9524c45a3f596b16611","observation_id":"04c8d0e3-cb37-4f94-96ac-568ca63cdc54","resolution":{"observed_at":"2026-08-11T12:18:38.550049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.616320Z","title":"Scaling laws for generative mixed-modal language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.616320Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:a7eb2fcc1e1c4b761ad3ec192c49bd0919f4defaab15c76f3dbf4f2aad4c8c57","observation_id":"d9e123a1-2b13-4e5c-9d06-3c722eafefbf","resolution":{"observed_at":"2026-08-11T12:18:38.616320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03449","last_updated":"2023-11-06T19:00:05Z","snapshot_observed_at":"2026-08-16T14:45:32.790742Z","submitted_at":"2023-11-06T19:00:05Z","title":"Into the LAIONs Den: Investigating Hate in Multimodal Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03449","snapshot_observed_at":"2026-08-11T12:18:38.759641Z","title":"Into the laions den: Investigating hate in multimodal datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.759641Z"},"links":{"cited_paper":"/paper/2311.03449","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:5d609afe5f03807d91d4e0a0f8f54001d0a47d02bba80a6a2bf55bcc736bb486","observation_id":"b367f587-fa50-47ed-bc01-c0d2b9d1fc8d","resolution":{"observed_at":"2026-08-11T12:18:38.759641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T12:18:38.831652Z","title":"Blattmann, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.831652Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:c6349898864c68d5571b376916730834586d1c420348ac6e82a3424f3bba8732","observation_id":"f31d00a1-0f37-4769-92c6-c1a21d9d20f0","resolution":{"observed_at":"2026-08-11T12:18:38.831652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.836900Z","title":"Bommasani, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.836900Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:4d5e898d085aca32ebe70da5f93bb647f667ad3730afef785aed2bafad1192b3","observation_id":"72403e49-9387-489e-a2db-bb198f835fdf","resolution":{"observed_at":"2026-08-11T12:18:38.836900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.849686Z","title":"Quantifying mem- orization across neural language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.849686Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:318329f521f02156616cb5978ee3683d2fe5fe37b9307743a1bc4ab60cd821b7","observation_id":"ce871711-4c48-4f9b-b65a-a3446da89ae4","resolution":{"observed_at":"2026-08-11T12:18:38.849686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.855948Z","title":"Extracting training data from diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.855948Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:08ce9b2bc00c87271dbc2fec070adbcadc761f3f50fbcddd19d4913cadfed8f0","observation_id":"a42caaa4-cdcb-45c4-9ead-d19002074711","resolution":{"observed_at":"2026-08-11T12:18:38.855948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.860032Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.860032Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:34dab17b28f91783a943d4d67238125909529e5933f1286787618b3b2eeaf387","observation_id":"54fe29a2-755f-4047-99b8-789c979b5006","resolution":{"observed_at":"2026-08-11T12:18:38.860032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.864990Z","title":"Gender bias in hiring: An analysis of the impact of amazon’s recruiting algorithm,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.864990Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:3ab4f34dc1301ca3ca7147fdd38a19731f1e0b270d08f883b28968c4c27a301f","observation_id":"f815bbd4-4f46-493a-bb30-8184f486d2d7","resolution":{"observed_at":"2026-08-11T12:18:38.864990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.869440Z","title":"Can language models be instructed to protect personal information?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.869440Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:51531527fc76814710c323cfcee110ca3737aa0ce190d6c1244d0182983a9bf7","observation_id":"2ed54f6d-6903-4bf5-b6ef-d471d05808f1","resolution":{"observed_at":"2026-08-11T12:18:38.869440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.873717Z","title":"Dialect corpora from youtube,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.873717Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:efe0b57d893dc54866c0b682c009d2e147f46c4b081954e595bda58f727d8ab9","observation_id":"6a7cf425-41ba-471c-a819-b8dd29c195ea","resolution":{"observed_at":"2026-08-11T12:18:38.873717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.877961Z","title":"Ai image training dataset found to include child sexual abuse imagery,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.877961Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:0ea717bed2ba783f0df932923b0270b5c94d554826cc7b0bc7e1561d1f3a2ef5","observation_id":"3608ee7b-d191-4736-a7ab-13f3ac2ec008","resolution":{"observed_at":"2026-08-11T12:18:38.877961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.882071Z","title":"What’s in my big data?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.882071Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:7a34beb11422329c8dddce4d63de56e21874473a8aaed5b87fdc97b3086ea855","observation_id":"ac8b0b81-05d2-44d2-80ab-8b9b75a26d3c","resolution":{"observed_at":"2026-08-11T12:18:38.882071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03011","last_updated":"2023-02-06T18:50:23Z","snapshot_observed_at":"2026-08-16T15:57:19.481262Z","submitted_at":"2023-02-06T18:50:23Z","title":"Structure and Content-Guided Video Synthesis with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03011","snapshot_observed_at":"2026-08-11T12:18:38.886382Z","title":"Esser, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.886382Z"},"links":{"cited_paper":"/paper/2302.03011","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:fe1a4f6a20b16d04c4c752e0221392aae5e991e48df02feb5397672ea8160868","observation_id":"a7580bb9-13e2-45ef-a91d-4514cebb8114","resolution":{"observed_at":"2026-08-11T12:18:38.886382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:38.973189Z","title":"Datacomp: In search of the next generation of multi- modal datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:38.973189Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:ce964c989366fda0320e0fe41020aa2bb1b62ea050c1823de695c3efab40bb90","observation_id":"2a39e77d-7742-41f5-89f1-707f3d4021a5","resolution":{"observed_at":"2026-08-11T12:18:38.973189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15715","last_updated":"2023-03-28T03:58:40Z","snapshot_observed_at":"2026-08-17T10:44:41.966656Z","submitted_at":"2023-03-28T03:58:40Z","title":"Foundation Models and Fair Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15715","snapshot_observed_at":"2026-08-11T12:18:39.033787Z","title":"Foundation models and fair use,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.033787Z"},"links":{"cited_paper":"/paper/2303.15715","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:fe5bb0d72c1752d8851c97d345a2455930a91bd76d9e77837814e27c0b9f4c35","observation_id":"d0cf6703-313f-457b-8b67-e58098545fd6","resolution":{"observed_at":"2026-08-11T12:18:39.033787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10105","last_updated":"2024-04-14T01:15:31Z","snapshot_observed_at":"2026-08-16T14:59:40.231658Z","submitted_at":"2023-09-18T19:28:48Z","title":"Understanding Catastrophic Forgetting in Language Models via Implicit Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10105","snapshot_observed_at":"2026-08-11T12:18:39.147383Z","title":"Understanding catastrophic forgetting in language models via implicit inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.147383Z"},"links":{"cited_paper":"/paper/2309.10105","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:38a96462ec7aa02590c092b245c9c6fc2f881466df5511f7fa7adc34b31ad763","observation_id":"317b730d-7fe8-4779-9215-d5d98a852ac5","resolution":{"observed_at":"2026-08-11T12:18:39.147383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01684","last_updated":"2024-01-11T00:17:43Z","snapshot_observed_at":"2026-08-16T15:27:03.575086Z","submitted_at":"2023-06-02T16:59:36Z","title":"Harnessing large-language models to generate private synthetic text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01684","snapshot_observed_at":"2026-08-11T12:18:39.153956Z","title":"Harnessing large- language models to generate private synthetic text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.153956Z"},"links":{"cited_paper":"/paper/2306.01684","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:050ba3e447ef2053d503773dd9bc99499ee4b19d8ec06c1b0a29e990cd6dadeb","observation_id":"483f2c46-0785-4b07-8c37-a8775c89a0a9","resolution":{"observed_at":"2026-08-11T12:18:39.153956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.158999Z","title":"Platypus: Quick, cheap, and powerful refinement of llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.158999Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:6ecd8090df0c39acee364ef88b6c60f7be266fd5448d7ddc228d0d33d8e2cdb9","observation_id":"7aa2bb08-689a-4eee-a193-db704d874c8d","resolution":{"observed_at":"2026-08-11T12:18:39.158999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08133","last_updated":"2024-03-01T20:28:59Z","snapshot_observed_at":"2026-08-16T15:00:32.521564Z","submitted_at":"2023-09-15T04:02:48Z","title":"Talkin' 'Bout AI Generation: Copyright and the Generative-AI Supply Chain","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08133","snapshot_observed_at":"2026-08-11T12:18:39.164488Z","title":"Talkin”bout ai generation: Copyright and the generative-ai supply chain,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.164488Z"},"links":{"cited_paper":"/paper/2309.08133","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:e46e3c7eb44160d1709fca1abb0f6ec443f2b3b63a9d681053edd6940873efb8","observation_id":"ba48ea07-989c-47a4-aee0-07531fc70397","resolution":{"observed_at":"2026-08-11T12:18:39.164488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.170432Z","title":"Yodas: Youtube- oriented dataset for audio and speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.170432Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:98986f489c91941b9234ed885ad18139e559e7adce72f07fb8df58cd7f488609","observation_id":"7e49434b-f6f6-430c-af41-0691e3e4fcdc","resolution":{"observed_at":"2026-08-11T12:18:39.170432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.176280Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.176280Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:ca6a58fac119bed855a1d6ab3a3e6ba66e57a8244c3ea3fc78b5abad9e97f8e9","observation_id":"d11f82cf-ddcf-4ed4-ab4a-5c78826f1023","resolution":{"observed_at":"2026-08-11T12:18:39.176280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.181162Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.181162Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:8d9f3bcb644c503d28916b9435feeb282741ff686da26e66bd5e1aafe116b37d","observation_id":"d8fd51e7-8672-4417-a2aa-442e460dd04e","resolution":{"observed_at":"2026-08-11T12:18:39.181162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13169","last_updated":"2023-11-13T14:50:06Z","snapshot_observed_at":"2026-08-16T15:31:01.501526Z","submitted_at":"2023-05-22T15:57:53Z","title":"A Pretrainer's Guide to Training Data: Measuring the Effects of Data Age, Domain Coverage, Quality, & Toxicity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13169","snapshot_observed_at":"2026-08-11T12:18:39.186213Z","title":"Longpre, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.186213Z"},"links":{"cited_paper":"/paper/2305.13169","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:da375af1085cf7e885ec3b4ce1ff44ea4f05f094644496cffaf77b9b7c1bc309","observation_id":"de67c4b4-c154-4763-9730-cf52a8102e86","resolution":{"observed_at":"2026-08-11T12:18:39.186213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.191010Z","title":"Discit ergo est: Training data provenance and fair use,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.191010Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:450499b4a029567ce2a80339f13b508a9239b89296725bd03b0974e1c06442a6","observation_id":"fdb8e334-5406-470b-95e3-22b98326fd19","resolution":{"observed_at":"2026-08-11T12:18:39.191010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.195797Z","title":"Mahari, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.195797Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:c2ea20842969d6e0d4fbde931ecd1900254a778569074aa45a894259eb29d614","observation_id":"a9b0fc45-814d-4f19-b5e5-308d7dc85e21","resolution":{"observed_at":"2026-08-11T12:18:39.195797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04564","last_updated":"2023-09-08T19:34:05Z","snapshot_observed_at":"2026-08-16T15:02:10.343729Z","submitted_at":"2023-09-08T19:34:05Z","title":"When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04564","snapshot_observed_at":"2026-08-11T12:18:39.200726Z","title":"Marion, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.200726Z"},"links":{"cited_paper":"/paper/2309.04564","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:866dae4d36a771016a9b78e857dfc607d6b343bef612bbdd66c5ac988b0e0423","observation_id":"53ee1090-4624-49ae-9838-0e175b389bef","resolution":{"observed_at":"2026-08-11T12:18:39.200726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.220163Z","title":"Silo language models: Isolating legal risk in a nonparametric datastore,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.220163Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:4812967eec8b1b13c1e575995f0919cfdcfe4fa15c86ea07c3653166518050f8","observation_id":"741641ef-285f-4674-9d8e-3baea912e8ec","resolution":{"observed_at":"2026-08-11T12:18:39.220163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.369149Z","title":"Licensed to learn: Mitigating copyright infringement liability of generative ai systems through contracts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.369149Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:8b7b944be0520f805315801a5f2e9600d30522c0d952b70f7367c05c8b964c83","observation_id":"86a62542-018e-444d-bf1a-c8f8262d6ac3","resolution":{"observed_at":"2026-08-11T12:18:39.369149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.375354Z","title":"Crosslingual generalization through multitask finetuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.375354Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:edb7980bab47dd5624baaaf6de50c7fa1bd7253b5ba45cf01191389532d61ee7","observation_id":"46cfb70d-acf1-4ec1-a188-4a4217883aa6","resolution":{"observed_at":"2026-08-11T12:18:39.375354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.380955Z","title":"The RefinedWeb dataset for falcon LLM: Outperforming curated corpora with web data, and web data only,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.380955Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:914c629624622cf1186ca870af32500ab74fb3fa7f25f8c46f15da650eb55cd7","observation_id":"1475fb1c-0e1b-4d11-8334-90ac6fdb744d","resolution":{"observed_at":"2026-08-11T12:18:39.380955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.385524Z","title":"Reproducing whisper-style training using an open-source toolkit and publicly available data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.385524Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:798936c545ef6930621854ec2aa3a6dbc8a76a187f78b7ae6c100ca594613002","observation_id":"f924aa00-fc87-41a6-93f1-51e58f558f97","resolution":{"observed_at":"2026-08-11T12:18:39.385524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04838","last_updated":"2023-03-08T19:17:05Z","snapshot_observed_at":"2026-08-16T15:49:43.209642Z","submitted_at":"2023-03-08T19:17:05Z","title":"The Casual Conversations v2 Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04838","snapshot_observed_at":"2026-08-11T12:18:39.389698Z","title":"Porgali, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.389698Z"},"links":{"cited_paper":"/paper/2303.04838","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:9a3c185fd6d817fe590ffdcb739f7505ddeb48ac3d144d2194740b4e9b1eccaf","observation_id":"3e1ca41a-b4bd-4842-b4f9-97955803c8b8","resolution":{"observed_at":"2026-08-11T12:18:39.389698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07589","last_updated":"2023-10-11T15:30:35Z","snapshot_observed_at":"2026-08-16T14:53:01.254251Z","submitted_at":"2023-10-11T15:30:35Z","title":"Goodtriever: Adaptive Toxicity Mitigation with Retrieval-augmented Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07589","snapshot_observed_at":"2026-08-11T12:18:39.394434Z","title":"Pozzobon, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.394434Z"},"links":{"cited_paper":"/paper/2310.07589","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:0b65e8f68f8976de6feb933fb1618279a3a67823b51aabad9639a036d3ada61d","observation_id":"68096db9-cb6e-44ed-b8c4-2a61e4ca4d73","resolution":{"observed_at":"2026-08-11T12:18:39.394434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.399058Z","title":"End-to-end speech recognition: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.399058Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:669163d0a282994834b13f0c5fc67f06be384e69359a2a51b8c9f1a14c0eb8e2","observation_id":"f666d717-3996-42c5-82a0-8677c9420887","resolution":{"observed_at":"2026-08-11T12:18:39.399058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:18:39.403513Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.403513Z"},"links":{"citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:5159f0fabac666a2d46e526a2caf5acfd2a2557ff19d33bd6d62e411469f6930","observation_id":"7befe848-6fbc-43f0-931b-1f71b3d37d24","resolution":{"observed_at":"2026-08-11T12:18:39.403513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-11T12:18:39.408235Z","title":"Direct pref- erence optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-11T12:18:39.408235Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2412.17847"},"observation_digest":"sha256:0b88cd23331438f4cd246758caa187c4b0d30fc67a6fff3a4d6d46be2f5a97d4","observation_id":"08285e19-b154-4f80-a186-dafb12fe9f95","resolution":{"observed_at":"2026-08-11T12:18:39.408235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.17847","last_updated":"2025-02-19T03:05:56Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T07:46:19.860254Z","submitted_at":"2024-12-19T01:30:19Z","title":"Bridging the Data Provenance Gap Across Text, Speech and Video"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":95,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":294},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 294 outbound references and 4 inbound Pith citation observations for arXiv:2412.17847."}