{"as_of":"2026-08-07T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:674ff816d2dc27cc7c74cea327f5e2c52ee6f45a166f88b0a0efd4e7a5364bcf","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:42:55.545446Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25356/citation-record","integrity":"/paper/2607.25356/integrity","json":"/paper/2607.25356/citation-record.json","paper":"/paper/2607.25356"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.470456Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.470456Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:c63fc90c9977224b61970520d1104f9aee1b6bd85135bd4a7751b87a3d57df2f","observation_id":"ebcf8ea9-d0fa-43ea-b1ae-0e220f4c76ec","resolution":{"observed_at":"2026-08-01T02:42:55.470456Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00778-015-0389-y","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VLDB Journal24(4), 557–581 (2015).https://doi.org/10.1007/s00778-015-0389-y","venue":"The VLDB Journal","work_id":"96f1d3dd-39df-41b9-90d6-5d5cef22bb8d","year":2015},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.473362Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:0eadffa6a5b3e0a787914fe1b34aa083e7a5f144e84d68fcc31eecc69e76e108","observation_id":"c17146a0-6516-4d8b-8229-561d86ce0e45","resolution":{"observed_at":"2026-08-01T02:46:04.029012Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.476110Z","title":"In: EuroSys","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.476110Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:de240a745b1406d611ec22e009428c89c81ad17d356feb2762cc04107a9f1922","observation_id":"83f63ccb-c613-4ad8-8d36-e9e469b282f3","resolution":{"observed_at":"2026-08-01T02:42:55.476110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.478813Z","title":"Knowledge and Information Systems11(2), 191–215 (2007).https: //doi.org/10.1007/s10115-006-0006-x","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.478813Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:b319aa8c8040c6476b7ab4e55260f0be99f79cf25032ab7bfe0e37224e201746","observation_id":"c03a6bbf-19ad-4355-b89e-9ad01523890f","resolution":{"observed_at":"2026-08-01T02:42:55.478813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.481306Z","title":"In: 34th IEEE International Conference on Data Engineering (ICDE)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.481306Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:fef07bd6f0c6e136967e58979b78fa492fddf45e5bbbb14cb01175dbb18dd00e","observation_id":"aa72373f-dc03-4200-a67b-ba9c642ad95b","resolution":{"observed_at":"2026-08-01T02:42:55.481306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1504/ijiq.2011","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:46:03.599081Z","title":"International Journal of In- formation Quality2(4), 300–323 (2011).https://doi.org/10.1504/IJIQ.2011","venue":null,"work_id":"1c1f6556-1bff-4768-bc12-9c36e50751ad","year":2011},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.483768Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:c6304c5aa6aae471a207051a55436b7a2280eab31cf3e1bafa9c511edec4ab29","observation_id":"344e2ecd-7b8f-4cae-8012-f6db23f8f6f4","resolution":{"observed_at":"2026-08-01T02:46:03.681120Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.486438Z","title":"Proceedings of the VLDB Endowment (PVLDB)11(8), 880–892 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.486438Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:1461c9b8045d8536d255089ec366f4c35cb379cb5f49c3014287568a7e5c4cba","observation_id":"d0ca955f-ace3-49d1-8bc4-31e429cb149f","resolution":{"observed_at":"2026-08-01T02:42:55.486438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03098","last_updated":"2021-03-01T22:39:49Z","snapshot_observed_at":"2026-07-31T00:25:51.111998Z","submitted_at":"2021-03-01T22:39:49Z","title":"Accounting for Variance in Machine Learning Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03098","snapshot_observed_at":"2026-08-01T02:42:55.488694Z","title":"2103.03098","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.488694Z"},"links":{"cited_paper":"/paper/2103.03098","citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:b6f65fd99b681ae26ae701536efda976ca7d232492c64978222a3b30f2818a0c","observation_id":"e517e830-bdc9-496e-96ce-a89bcbc70208","resolution":{"observed_at":"2026-08-01T02:42:55.488694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.491775Z","title":"Nature Reviews Neuroscience14(5), 365–376 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.491775Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:e74a816f4bb94584036473dc5f9db3a03b8bdff235ff8d7bb3c188d373b70590","observation_id":"f48967d9-32d6-4535-8501-a730fffb12c6","resolution":{"observed_at":"2026-08-01T02:42:55.491775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.494039Z","title":"Foundations and Trends in Databases 4(1–3), 1–294 (2011).https://doi.org/10.1561/1900000004","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.494039Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:fcbdf5a53309f241f2dbcf01eed41b02601cc7934a7857487583347d8534a4bf","observation_id":"7304a623-dd3f-4b63-8dfc-350e558ffa9c","resolution":{"observed_at":"2026-08-01T02:42:55.494039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.496138Z","title":"In: Information Processing Letters","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.496138Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:504b2a69d6041fec37326901391f390c60d00cde7485e7d3c9ce513b97484d1f","observation_id":"616253c6-1124-42c7-a9f5-5b1ee152aad5","resolution":{"observed_at":"2026-08-01T02:42:55.496138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00778-021-00726-w","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VLDB Journal31, 1103–1126 (2022).https://doi","venue":"The VLDB Journal","work_id":"b8cf5542-2f97-4ce6-9d10-e0f62e4ec7fc","year":2022},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.498363Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:ba4904510b847473be312fd1ad1d5217aa26b3cf3c4b5dc1c6c4859e1a34dc73","observation_id":"22f90487-d2ed-4079-a0f0-339e88ebb8cf","resolution":{"observed_at":"2026-08-01T02:46:03.491825Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.500688Z","title":"In: SIGMOD","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.500688Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:44cc5491eacce608cd347963a6e81bcd30547d9c68f29cf5540cac200b2ed50a","observation_id":"9de3d662-3e63-4a01-b471-3d36155eb2e0","resolution":{"observed_at":"2026-08-01T02:42:55.500688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.502740Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.502740Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:0d6d918cc342ae670473764477c1b75040142bbecee1391966b490f4a7baf88d","observation_id":"23998afe-7723-4499-9762-3c1692219000","resolution":{"observed_at":"2026-08-01T02:42:55.502740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.504654Z","title":"In: SIGMOD","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.504654Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:f9ad6e0d82918181f8488550c987eb5eaa73d0c05841efa641bdd7ecb65f982b","observation_id":"b70c7965-e576-4636-abdb-78949eed0131","resolution":{"observed_at":"2026-08-01T02:42:55.504654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.506647Z","title":"Journal of the American Statistical Association47(260), 663–685 (1952).https://doi.org/10.1080/01621459.1952.10483446","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.506647Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:7a664bab94764a014bc6632e47af6615700ff9e0a184e5278e6f71de05c5d148","observation_id":"c259018a-c011-4471-a5f6-e66f24f2c647","resolution":{"observed_at":"2026-08-01T02:42:55.506647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.508852Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.508852Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:859c32272fb3c8a9965401457512e3bc8b75678eca06b7dfe8595d600b63d192","observation_id":"b78ad454-5b88-4ced-b5b8-9f57123e089f","resolution":{"observed_at":"2026-08-01T02:42:55.508852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.510797Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.510797Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:cb93ef0546de0df28af6b0c62afcfadfca2485d7c16129be129620674118f525","observation_id":"8ae5962c-4399-42da-8b6b-ced77e611ff5","resolution":{"observed_at":"2026-08-01T02:42:55.510797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10062","last_updated":"2023-10-13T15:24:24Z","snapshot_observed_at":"2026-07-06T13:33:32.029850Z","submitted_at":"2022-07-20T17:47:54Z","title":"DataPerf: Benchmarks for Data-Centric AI Development","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10062","snapshot_observed_at":"2026-08-01T02:42:55.512734Z","title":"In: Advances in Neural Information Processing Systems 36 (NeurIPS), Datasets and Benchmarks Track (2023).https://doi.org/10.48550/ arXiv.2207.10062","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.512734Z"},"links":{"cited_paper":"/paper/2207.10062","citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:6464448c9913415add1b4497f76c508d3523c3fa1bd1c2d97df859a7ec42acca","observation_id":"6be7504d-fa09-4b81-9a2f-b2d725cef06f","resolution":{"observed_at":"2026-08-01T02:42:55.512734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-01835-0","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Morgan & Claypool Publishers (2010).https://doi.org/10.1007/978-3-031-01835-0","venue":"Synthesis lectures on data management","work_id":"1bf78dee-9af1-4aeb-aa90-35ce1dd8e030","year":2010},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.515953Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:ed4325d50fabfe15009cb04178160d11dc979f20dd0cb800add037f4858c2487","observation_id":"d52715c0-f1fe-4d4e-82ef-d57525bacc00","resolution":{"observed_at":"2026-08-01T02:46:03.226285Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.518591Z","title":"Journal of the Royal Statistical Society97(4), 558–625 (1934).https://doi.org/10.2307/2342192","venue":null,"work_id":null,"year":1934},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.518591Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:d1ad56d044a7ea867f30f18ded2d06001b8f812614b771a93e2f19dcaffbcc08","observation_id":"a6aa741d-b325-458b-a467-a92d7017bb8d","resolution":{"observed_at":"2026-08-01T02:42:55.518591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.520841Z","title":"In: SIGMOD","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.520841Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:d3b0d3b66da5507358686eaa123e0208993286589ae19040b6f100216b4b3524","observation_id":"17a5d66c-72bb-4eca-8874-35bab721fc14","resolution":{"observed_at":"2026-08-01T02:42:55.520841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.522945Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.522945Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:8f621078fc49c55d59d9f7ae047577942d96ed65a92819455860cb76f47c9ee4","observation_id":"cf2229eb-6755-450d-bfbc-89e3d5fd8d59","resolution":{"observed_at":"2026-08-01T02:42:55.522945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.524999Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.524999Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:05869486a6bf19d80533ef8265dcf5a05f83633ca85b8c3e200654c52b2095d6","observation_id":"49f3fcce-e2c3-4bdb-b482-8d9f255d6ae3","resolution":{"observed_at":"2026-08-01T02:42:55.524999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.526963Z","title":"PVLDB1(1), 797–808 (2008).https://doi.org/10.14778/1453856.1453943","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.526963Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:d7319ca0ced46053c8a9c2052084d343baef8f4862a49a7c05dfb30366b5760c","observation_id":"771ace62-ed4b-47af-8ee9-0a9d22f66ffd","resolution":{"observed_at":"2026-08-01T02:42:55.526963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.529009Z","title":"In: VLDB","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.529009Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:9dea799b6cc65988190c82185c110cb7a60a46d8853a81869dee745dfe58f1a5","observation_id":"048dee47-3ab7-4735-b10e-69ae6344ebac","resolution":{"observed_at":"2026-08-01T02:42:55.529009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.530907Z","title":"Proceedings of the VLDB Endow- ment (PVLDB)11(12), 1781–1794 (2018).https://doi.org/10.14778/3229863","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.530907Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:9f08fcbc031417ae3f01a1fabf70774d416bcc0c3dcb7ffb17a5cd2ef8625bcd","observation_id":"dd6789c2-00ac-4739-a935-1c46519e2a5d","resolution":{"observed_at":"2026-08-01T02:42:55.530907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.533180Z","title":"Journal of the American Statisti- cal Association85(412), 1050–1059 (1990).https://doi.org/10.1080/01621459","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.533180Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:eb257cc57e05bffec06f92a4f4b80c24d7eee015a23aba571763ea8e23590355","observation_id":"8d4cf2e7-c499-4e92-8bd3-5e0cc1ee95c9","resolution":{"observed_at":"2026-08-01T02:42:55.533180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.535545Z","title":"In: Proc","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.535545Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:aff049239bd7004a715f837bb16b1643d14142b75950d3a56148c3048dcb0df9","observation_id":"8aabb816-416f-44b9-bd1f-98dbe7cc6c04","resolution":{"observed_at":"2026-08-01T02:42:55.535545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.537447Z","title":"ACM Transactions on Mathemat- ical Software11(1), 37–57 (1985).https://doi.org/10.1145/3147.3165 Data Quality Profiling at Scale with Progressive Sampling 29","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.537447Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:391c597fd5370ee0c85c57bdf166a10c2550dc4af20881a69f8db6d1ad367853","observation_id":"11dded96-7b88-48f3-85de-9b04de29b61e","resolution":{"observed_at":"2026-08-01T02:42:55.537447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.539381Z","title":"VLDB Journal32(4), 791–813 (2023).https://doi.org/10.1007/s00778-022-00775-9","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.539381Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:d9f3ef25769326b0573090a87fe07934a99e8879e141c269a08e99f06421ac82","observation_id":"44c7d0b8-aec7-432c-b74c-19cc00a81ad4","resolution":{"observed_at":"2026-08-01T02:42:55.539381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.541489Z","title":"Harper and Row, New York, 2nd edn","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.541489Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:01edf39cd4a1efb4229bde82f8bb22d45073a944b506e8c93e48a078c4d16e75","observation_id":"07b60f94-8b27-44d5-b6a3-795b533c2b8f","resolution":{"observed_at":"2026-08-01T02:42:55.541489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.543459Z","title":"ACM Computing Surveys57(5) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.543459Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:1c4d0cc02680fc5e5934bd2167db0aec355a1cd796569f0ed953c875e5e9ef1b","observation_id":"8dddac27-d984-4c77-9667-b44882ac0886","resolution":{"observed_at":"2026-08-01T02:42:55.543459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:42:55.545446Z","title":"In: Confer- ence on Innovative Data Systems Research (CIDR) (2025),https://www.vldb","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T02:42:55.545446Z"},"links":{"citing_paper":"/paper/2607.25356"},"observation_digest":"sha256:6111ad1eacaf35047f7224259d30dca23a13f8a958247c89bc84e7aadba21cad","observation_id":"0e05b97b-e4a7-4a75-aceb-9b95bb2ec36c","resolution":{"observed_at":"2026-08-01T02:42:55.545446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25356","last_updated":"2026-07-28T07:03:50Z","latest_version":1,"primary_category":"cs.DB","snapshot_observed_at":"2026-08-01T02:42:54.677056Z","submitted_at":"2026-07-28T07:03:50Z","title":"Data Quality Profiling at Scale with Progressive Sampling: A Benchmark for Data-Centric AI Pipelines"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.25356."}