{"as_of":"2026-08-09T05:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ea990a494f2ab0bf3aa891f17c97af778ffed532b4f36e9720e8f9b35d39213","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:18:56.509967Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.13892/citation-record","integrity":"/paper/2507.13892/integrity","json":"/paper/2507.13892/citation-record.json","paper":"/paper/2507.13892"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s13222-021-00399-3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:03.380124Z","title":"Four Generations in Data Engineering for Data Science","venue":null,"work_id":"498b0e25-a899-4044-a66b-ce73ccc6a40b","year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:41.756013Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:8ec0dbcc62e3a10da0be9b080280edfe196044593e81417d10de59e2e6aaffb1","observation_id":"40c34b85-378e-48a1-8bad-d04fcb325c01","resolution":{"observed_at":"2026-08-06T16:19:03.512947Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5334/dsj-2015-002","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:03.015353Z","title":"The Challenges of Data Quality and Data Quality Assessment in the Big Data Era","venue":null,"work_id":"e36085f1-3672-473f-b7cb-e3058dfa56ed","year":2015},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:41.867224Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:8a61c09981b2acacfa69b9709e76c070b4d0de9932f9e75dd34af8b1171eb0b6","observation_id":"94a77ea5-d14d-4680-824a-b6af53a10d4c","resolution":{"observed_at":"2026-08-06T16:19:03.152860Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:42.025709Z","title":"GouDa - generation of universal data sets: improving analysis and evaluation of data preparation pipelines","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.025709Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:ec7142306c7a1557706ce6caec36f40183fd27d8de777fd59c658269406b5931","observation_id":"0756e37d-8d62-40a0-8369-dee0f354f00b","resolution":{"observed_at":"2026-08-06T16:18:42.025709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3310205","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:02.668019Z","title":"Ilyas and Xu Chu","venue":null,"work_id":"ca0d2e29-8c62-43bc-8fca-e6ad2dd1978f","year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.173188Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:2b0ca7335b3a3cb2e5ac879a6c6ceaae54c5c369947c5ebbfbd849622ec921b2","observation_id":"be4d4c17-5977-4445-915e-d37714b117ea","resolution":{"observed_at":"2026-08-06T16:19:02.825032Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5220/0010517301650175","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:02.374658Z","title":"DERM: A reference model for data engineering","venue":null,"work_id":"0ff38fb5-02e2-4a30-9023-50ab2696abfc","year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.318708Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:6e82e760d11c7592df1304a9097ba9dbcf9ce7d26e9db7ed1289f4ba5b321690","observation_id":"3864a190-32f4-4cae-a87a-5f0e1ae565d3","resolution":{"observed_at":"2026-08-06T16:19:02.504718Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:42.435103Z","title":"A Survey of Big Data Pipeline Orchestration Tools from the Perspective of the DataCloud Project","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.435103Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c6e6cefd5f1f39112de7fa5834ef8668bbf504ca38f57b154833985e05f3cd41","observation_id":"5b8ace07-6085-4c52-bf0f-a0d79c3390ca","resolution":{"observed_at":"2026-08-06T16:18:42.435103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:42.546386Z","title":"Self-Awareness as a Prerequisite for Self-Adaptivity in Computing Systems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.546386Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:ae0eca597fba62c76d3f8a658a8c7f27d78e8f7c3dfd4c8a975c57a120620d49","observation_id":"cfe8edf3-12ac-4cdd-b125-85df3db5a476","resolution":{"observed_at":"2026-08-06T16:18:42.546386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:42.645354Z","title":"Data Processing Pipeline for Eye-Tracking Analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.645354Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c35f570ee3926e9659fb2e5a29cb43aee900642b60a2e8881b68c331d967d3c5","observation_id":"ed754591-e80a-4aa4-ba26-197b39bc76a2","resolution":{"observed_at":"2026-08-06T16:18:42.645354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s40537-022-00613-3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:02.009874Z","title":"A unified representation and transformation of multi-model data using category theory","venue":null,"work_id":"7ec1ddf0-9f7d-4ddf-a029-24654e2ba8f9","year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.744569Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c5b9d403d38a5a2531000c02fc43578d1dfa1051b7eda8e9a5668b91f2b94b31","observation_id":"18411631-4674-4216-94fd-20836d84c79a","resolution":{"observed_at":"2026-08-06T16:19:02.140214Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-59065-9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Data Engineering for Data Science: Two Sides of the Same Coin","venue":"Lecture notes in computer science","work_id":"801ec08f-fbf4-41b3-b739-bc497bdd4d21","year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.817650Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:7896ebffaa40b3e20ecc1a8eeb7c39c96b84664fcecfb2696db43cdadf4dc020","observation_id":"03427adb-de7d-4690-9928-e8d832e0ab27","resolution":{"observed_at":"2026-08-06T16:19:01.880923Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:42.923905Z","title":"The Art and Practice of Data Science Pipelines: A Comprehensive Study of Data Science Pipelines In Theory, In-The-Small, and In-The-Large","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.923905Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:7ea626e27a74eb22f064c05015db7264ff5727d65c4454be7221d43926988839","observation_id":"35cbfb20-48f1-4cf2-a1d5-a70eb1286c15","resolution":{"observed_at":"2026-08-06T16:18:42.923905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:43.034773Z","title":"What About the Data? A Mapping Study on Data Engineering for AI Systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.034773Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:8ee854b9d4fb9b1cf0b51088ff2bbc80638b6ef8a101845d85bb655747958ed3","observation_id":"1133a35d-b3c8-4d56-876d-772f4b8247c7","resolution":{"observed_at":"2026-08-06T16:18:43.034773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:13.928120Z","title":"NIST Big Data Interoperability Framework: Volume 1, Definitions","venue":null,"work_id":"a97e1cae-e5a8-4739-b218-708fcf1ca5c2","year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.105873Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:2e62a017ba482c07154df80daa54e33c5f20114354aa96437c7328ece5014589","observation_id":"22544497-827b-4451-973d-86389909c620","resolution":{"observed_at":"2026-08-06T16:19:14.102889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5220/0007748803510358","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:01.520551Z","title":"Challenging Big Data Engineering: Positioning of Current and Future Development","venue":null,"work_id":"ead69a09-e7f0-4752-9ae0-6af6ed439478","year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.181397Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:718efd179e8dc9894c5304cedb504f74a0f410b94f755e0849cb15c5ed2dcbbe","observation_id":"5cb83274-5eb8-4ccb-b7a7-67cb84b7eaf6","resolution":{"observed_at":"2026-08-06T16:19:01.614329Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3012429","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:01.274525Z","title":"Atkinson, Michelle Galea, Tan Fong Ang, Paul Martin, and Jano I","venue":null,"work_id":"0a19e17a-060f-4fe4-bb01-9dd0679d116c","year":2017},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.321961Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:2ba87369d01b697872035cb56278d4f9d1051aebcc246503c930ef9cd2e8ff4a","observation_id":"f8181db7-1c87-4bf4-ade5-b1612e73ccd8","resolution":{"observed_at":"2026-08-06T16:19:01.390862Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3470918","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:01.058636Z","title":"Mahadi Hassan, Micah J","venue":null,"work_id":"ff98a686-1906-4988-b8b1-08acae82713a","year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.431857Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:65415e14ad5f0055b88bad88711e2d0198ff5f10f6fc86c36b56aaea4e007a50","observation_id":"2284ebe6-6d11-42f9-8c80-0430df611a18","resolution":{"observed_at":"2026-08-06T16:19:01.143652Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:43.534296Z","title":"Parameswaran","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.534296Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c027ebca09181c0acc13a13b8bd6ff704de4d33cea155dbf55fb6d10077de722","observation_id":"03340358-19f9-4b9d-aa6c-fbd902eae405","resolution":{"observed_at":"2026-08-06T16:18:43.534296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.01299","last_updated":"2017-11-03T18:50:08Z","snapshot_observed_at":"2026-07-31T01:57:34.961257Z","submitted_at":"2017-11-03T18:50:08Z","title":"BoostClean: Automated Error Detection and Repair for Machine Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.01299","snapshot_observed_at":"2026-08-06T16:18:43.667369Z","title":"Franklin, Ken Goldberg, and Eugene Wu","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.667369Z"},"links":{"cited_paper":"/paper/1711.01299","citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:dfbee90e316083812684cb6cd5d2b25ae96d12bb46c65d72922f08e372a31291","observation_id":"7eada81a-f551-4013-8b0e-9237d1cbb8d8","resolution":{"observed_at":"2026-08-06T16:18:43.667369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:43.831195Z","title":"Ilyas, and Christopher R \\' e","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.831195Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c51738e53d8b7457a811c2fe60922bea166fa9080d785d01b5f1d293d39b185c","observation_id":"dc47e29c-8163-4f83-94c6-cdc3ea9b55fd","resolution":{"observed_at":"2026-08-06T16:18:43.831195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:13.534668Z","title":"Baran: Effective Error Correction via a Unified Context Representation and Transfer Learning","venue":null,"work_id":"2563d7e1-30d4-45d0-8344-82762f995f1f","year":1948},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.007682Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:25f1b634bbd9d086e464138262d16834ddb4f882a34cf77a26bcf2b953846c6e","observation_id":"30579814-a446-4425-8d80-726231629518","resolution":{"observed_at":"2026-08-06T16:19:13.712610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:44.119150Z","title":"Ilyas, Mourad Ouzzani, Paolo Papotti, Nan Tang, and Yin Ye","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.119150Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:0052952da189b2a2b3882fb591d2f6b789d2352fc7555aaa0f5b7895d389c2c1","observation_id":"dbb3a155-d975-466f-8cdd-ef592cbb0c9b","resolution":{"observed_at":"2026-08-06T16:18:44.119150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4831.34448","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:08.760594Z","title":"Data Preparation: A Survey of Commercial Tools","venue":null,"work_id":"3740f896-54aa-46ea-acac-ec699551be15","year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.222813Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:8a8b7da0e6930a44c2ec6da4c2edd695eea89b8ded93df11e01de87c10910dae","observation_id":"e010e491-a227-4679-be6e-4d6fafaed3f3","resolution":{"observed_at":"2026-08-06T16:19:08.846105Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:44.367791Z","title":"Ilyas, Mourad Ouzzani, Paolo Papotti, Michael Stonebraker, and Nan Tang","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.367791Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:8a89953117a7e98fe334735a10708c75f19d675d8b830a5a822460925714d24e","observation_id":"9c392eb5-99bb-4c59-8074-255c977f6666","resolution":{"observed_at":"2026-08-06T16:18:44.367791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:44.474675Z","title":"SAGA: A Scalable Framework for Optimizing Data Cleaning Pipelines for Machine Learning Applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.474675Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:b5673e2901a84869bd2e219b12a64f3135d8dd0b9233086fe6e280c614c804d8","observation_id":"ab76c142-cba3-4f79-add8-72450a41f533","resolution":{"observed_at":"2026-08-06T16:18:44.474675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:13.175483Z","title":"Lindstaedt, Arnab Phani, Benjamin Rath, Berthold Reinwald, Shafaq Siddiqui, and Sebastian Benjamin Wrede","venue":null,"work_id":"a4f10dd9-a892-4cc8-ae03-cbab9bb54687","year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.586308Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:fd4b942cacb16974fb8810479b2675ad2a73b34d3d2ed87b184070c35d980637","observation_id":"a6f41fb7-33f8-488d-b408-360c9512adf7","resolution":{"observed_at":"2026-08-06T16:19:13.321832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:12.840499Z","title":"From Cleaning before ML to Cleaning for ML","venue":null,"work_id":"fc31b095-6343-407e-8e75-403b264b60a9","year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.737629Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:7f0b460077dea4b11be35026333687915a45a57ef95745a37929ebe74bcc0cf0","observation_id":"067fa20d-4423-4ef7-bc5f-f58ef4e9cec0","resolution":{"observed_at":"2026-08-06T16:19:12.996169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:44.845270Z","title":"Paritosh, and Lora Aroyo","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.845270Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:b7cb17d5ada7e0b9b1d37e47038cc54f20a65ee1646d242bf252bf08a169bd52","observation_id":"ce0a72c7-5028-492a-91b2-fb02eedfdb1f","resolution":{"observed_at":"2026-08-06T16:18:44.845270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1993.34401","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:08.173367Z","title":"Wang, Henry B","venue":null,"work_id":"770173c7-5a1d-416c-b942-8d6ddfb69126","year":1993},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.928450Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:aedd95330502526bf29a1f2e5042fa8fa2927a528fabea33090f3b9d1cde52bf","observation_id":"af20534e-0d0c-466f-bf0a-71abb1bf04e2","resolution":{"observed_at":"2026-08-06T16:19:08.318269Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/69.404034","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:00.768965Z","title":"Wang, Veda C","venue":null,"work_id":"cb9c17c1-087d-457e-9256-b5e8dd839052","year":1995},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.106545Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:7050349f67d2d77d3d32f5922a6b93c387333f44d906f545b3a070a20f08ea53","observation_id":"ee335dc4-6420-4461-b28f-524d6137efeb","resolution":{"observed_at":"2026-08-06T16:19:00.879937Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1879.18918","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:07.767990Z","title":"Blake and Paul Mangiameli","venue":null,"work_id":"3b571cc2-377b-4e0b-b2e1-1207940f53ab","year":2011},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.202506Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:2110ef513b630827470145de8e216a26e008ea0db99963856b939ccc33a66d95","observation_id":"2cf102f1-7455-4173-a785-4a4da8951840","resolution":{"observed_at":"2026-08-06T16:19:07.875397Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3148238","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:00.414575Z","title":"Requirements for Data Quality Metrics","venue":null,"work_id":"781c0731-9c0b-45d5-a3d7-3d624a2a0c5e","year":2018},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.270701Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:4cceb252bc5b1708e20c1e5d5db03b5e64e55439746cac840cd90c53b962c903","observation_id":"8c2b710f-3c43-41bd-b7de-ff9297953421","resolution":{"observed_at":"2026-08-06T16:19:00.568298Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:45.364895Z","title":"Automating Large-Scale Data Quality Verification","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.364895Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:5ab2f5c16b138a29dee3a4b22535c5c116dff4a4218d6eb65abf04ae192ae9b5","observation_id":"1c881a64-4387-492c-8771-78050bee9a7d","resolution":{"observed_at":"2026-08-06T16:18:45.364895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/bdcc6040153","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:00.059581Z","title":"An Advanced Big Data Quality Framework Based on Weighted Metrics","venue":null,"work_id":"374d5d5c-49a8-476a-ad67-997fa0e5b43d","year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.444627Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:ab065691f8b2b6505a7c511d6c296d16e539898914e4297312c5610c5f0cebb5","observation_id":"c264d572-5459-4d5d-aebd-bc8ea426cd29","resolution":{"observed_at":"2026-08-06T16:19:00.211483Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:45.596320Z","title":"Ilyas, and Theodoros Rekatsinas","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.596320Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:cc64d575833b5df05aca851146f1329e70426020f6087d723796d5cbf17fed3b","observation_id":"276110cb-0a34-48e8-b365-d94ad012795e","resolution":{"observed_at":"2026-08-06T16:18:45.596320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:45.733770Z","title":"Raha: A Configuration-Free Error Detection System","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.733770Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:4411c4bf4084693fec6588e498999de9de32c6c39eb1250ad3b43c7332ba4c71","observation_id":"c1250404-282d-4db8-beaf-d2052589f7c1","resolution":{"observed_at":"2026-08-06T16:18:45.733770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3589280","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:59.662157Z","title":"Exploratory Training: When Annonators Learn About Data","venue":null,"work_id":"3cd1ce57-1398-476a-88e3-c58a9a6a5452","year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.839458Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:3c69d3e9bc1e25933e2ca4effd99aa30e6e7dfab67940cf17e6023e5d8a6e189","observation_id":"ed1b85c4-e91a-4df4-ba91-78d2f8c40ed1","resolution":{"observed_at":"2026-08-06T16:18:59.857478Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3190578","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:59.323689Z","title":"Visual Interactive Creation, Customization, and Analysis of Data Quality Metrics","venue":null,"work_id":"8cc59e11-ecd7-4424-b8e8-f6c50f4c61ff","year":2018},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.999251Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:b6dc89826718cc71300a5282d792d9fb4392756c7face6a879da14f7c7887a4e","observation_id":"68c935bb-21fc-4e92-a166-7089ba633af7","resolution":{"observed_at":"2026-08-06T16:18:59.519113Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:46.128170Z","title":"o rl. FAIR is not enough - A Metrics Framework to ensure Data Quality through Data Preparation . In BTW , volume P-331 of LNI , pages 917--929. Gesellschaft f \\","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.128170Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:901d1605ca9fb7deb0baf04bdccd0e4c01c3592b5109870dde8cd4bd06b5d10d","observation_id":"ebfbc258-4623-433f-b239-b96d8e04db31","resolution":{"observed_at":"2026-08-06T16:18:46.128170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18420/btw2025-70","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:58.902938Z","title":"a mper, Ralf Diestelk \\","venue":null,"work_id":"424ef63c-de6a-4803-8a27-3b474643bac9","year":2025},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.253498Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:10b8a9ceb3d631e650ef28eb8b55efd9e3e00cdd2e6301e747b8cc817007c747","observation_id":"ec7c24bb-e746-472b-9ed1-f1cd15e44842","resolution":{"observed_at":"2026-08-06T16:18:59.122839Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-319-16462-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"noWorkflow: Capturing and Analyzing Provenance of Scripts","venue":"Lecture notes in computer science","work_id":"12cc8b06-606d-49ff-8ebe-47531c6e757f","year":2014},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.368926Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:199b5319d2567aeba82bf358f54179ff0935549685652ad94caaa6fcd09e1f26","observation_id":"428eb458-3442-4c21-8bb9-2c47c38a6302","resolution":{"observed_at":"2026-08-06T16:18:58.742743Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6905.34369","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:07.030231Z","title":"Capturing and querying fine-grained provenance of preprocessing pipelines in data science","venue":null,"work_id":"08799701-785d-472f-9785-e9586352ab90","year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.515199Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c4aa995fe6d4f58d46bb58e88e9368ef178afc6c0f558078b23e183336e66fbf","observation_id":"36dd8162-afe2-4d83-9672-766d80b8b989","resolution":{"observed_at":"2026-08-06T16:19:07.197632Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:46.660215Z","title":"Data distribution debugging in machine learning pipelines","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.660215Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:81d5c49c033c4eb1adcda96d16920002091a2d9cd26d997497a7a94279011de6","observation_id":"368701ce-cc81-4492-a63c-22e5cd2310ca","resolution":{"observed_at":"2026-08-06T16:18:46.660215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:46.764359Z","title":"Fair preprocessing: towards understanding compositional fairness of data transformers in machine learning pipeline","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.764359Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c9a417f8d88395171090b6fc7ac617778098e8ccb5651e42998e03a588b59b20","observation_id":"cdfcaff6-c6d0-4f25-9108-5fda5092d033","resolution":{"observed_at":"2026-08-06T16:18:46.764359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:46.899502Z","title":"Towards Explaining the Effects of Data Preprocessing on Machine Learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.899502Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:2e4f3d64419b97d0aa67eef688f82237928175f253cfaf50a032374cb6af39ec","observation_id":"079e99aa-4eec-4b8f-b5d6-63e9fdd0b989","resolution":{"observed_at":"2026-08-06T16:18:46.899502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:47.046949Z","title":"Dead or Alive: Continuous Data Profiling for Interactive Data Science","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.046949Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:0d2eea8990d5b1672dbbc9fc7bcd0a86797d2aac504e701c3fc59c707892b788","observation_id":"013d21c9-b9f5-41b2-a139-7dadde31483a","resolution":{"observed_at":"2026-08-06T16:18:47.046949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:47.151185Z","title":"Data Profiling","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.151185Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:43762420c687f5043fa9d9e067f2291ecf5ae23406f39e00d29d0345e43fbb9c","observation_id":"e4df4c95-783c-49fa-a5d6-dfd6913d886a","resolution":{"observed_at":"2026-08-06T16:18:47.151185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:47.424147Z","title":"Auto-Validate by-History: Auto-Program Data Quality Constraints to Validate Recurring Data Pipelines","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.424147Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:f8b785ec2276b14d3ec4650e308080d03d9afcbc572a042e417bc24aa4594070","observation_id":"3436a317-46ec-4dcd-9f7e-9b2402f0c8fa","resolution":{"observed_at":"2026-08-06T16:18:47.424147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:47.546129Z","title":"Parameswaran","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.546129Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:fca5856308963a529e8c07c2b951113a1b42fb6a32d015ecd5eae4555a898aba","observation_id":"4e97e5b3-d4f6-401a-8497-85f15606a431","resolution":{"observed_at":"2026-08-06T16:18:47.546129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:47.659269Z","title":"A DaQL to Monitor Data Quality in Machine Learning Applications","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.659269Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:eb6aeb975388cea5af9ae06c2f6e7dcd94da4d45944d078080171dbd96ce6fbb","observation_id":"ce2fca88-5788-4b9c-973b-142dc610ed1d","resolution":{"observed_at":"2026-08-06T16:18:47.659269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.procs.2021.01.327","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:58.338518Z","title":"DaQL 2.0: Measure Data Quality based on Entity Models","venue":null,"work_id":"39c9c273-19e9-434f-a436-df5d0313f69d","year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.812609Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:b025a3588fb031cccd302eeb52bc48e609eb785cff1678f2067466cc9d03ea47","observation_id":"d88c3220-2028-491c-8d72-0c332fbad8fd","resolution":{"observed_at":"2026-08-06T16:18:58.455980Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:12.432338Z","title":"Real-Time Monitoring of Data Pipelines: Exploring and Experimentally Proving that the Continuous Monitoring in Data Pipelines Reduces Cost and Elevates Quality","venue":null,"work_id":"301c4b8a-deda-4ec2-8257-616cd7aa75d9","year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.931600Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:2ce0a2154683ea0648b2aa1b64d87f305c2c47d99b5ec3e9b51bf0bc681d8cbd","observation_id":"2f94c143-25fb-4fba-9b4a-93fb3e676313","resolution":{"observed_at":"2026-08-06T16:19:12.618911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:48.097225Z","title":"Schuler, Jitin Singla, Brinda Vallat, Kate L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:48.097225Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:34c041735658892684bc6fb3aecf386f06466b395b64d3d37d638ce857cbe924","observation_id":"07e4821b-96d4-4c39-b7d8-f0d55af075d8","resolution":{"observed_at":"2026-08-06T16:18:48.097225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:48.661781Z","title":"An Empirical Study on the Design and Evolution of NoSQL Database Schemas","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:48.661781Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:518a82ad8a6a3cba38c03a5a5668c5b4b4a72f016367d8b145f47d671655ab91","observation_id":"c81970a9-042b-4869-933a-df366cb6bf88","resolution":{"observed_at":"2026-08-06T16:18:48.661781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:11.992217Z","title":"Schema Evolution in Wikipedia - Toward a Web Information System Benchmark","venue":null,"work_id":"89a95822-4144-4d17-9ab2-e94043e16214","year":2008},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:50.676754Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:1dfc4fef869df7c107ccb1aa9bc0ba289b7fba119cd26d21ffab331860dcc15d","observation_id":"a1914ddf-841d-4de2-9108-9bf488ec2918","resolution":{"observed_at":"2026-08-06T16:19:12.200356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:11.618932Z","title":"Self-healing and self-repairing technologies","venue":null,"work_id":"c4651e47-f216-45cc-8f98-c4e68ff318a7","year":2013},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:52.847609Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:5e2f3dd43045b6f841490cca35d687d1aac7a366cca1011131794487a98b9e01","observation_id":"4d12e214-8898-41c5-baff-4d94962b8bbb","resolution":{"observed_at":"2026-08-06T16:19:11.809922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:53.008184Z","title":"DeBinelle: Semantic Patches for Coupled Database-Application Evolution","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.008184Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:f51ea533cd946aaff33f679abde244e6248d679dcfd801132a7ca689a13f027b","observation_id":"da0be5f1-c65e-4229-ab64-18ebc8b7b24b","resolution":{"observed_at":"2026-08-06T16:18:53.008184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:53.188784Z","title":"Schuler and Carl Kesselman","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.188784Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:35e9e20d848c96ad4ccca13e2d28178e9a3ae75e2b52d5b7217c3f9e5169ed45","observation_id":"428fe486-fac4-4bf2-9961-0b99e8951fac","resolution":{"observed_at":"2026-08-06T16:18:53.188784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:53.307232Z","title":"Understanding Uncertainty in Self-adaptive Systems","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.307232Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:45d7334bdb22e8ec9bc0999e15cc7e052d48d48c30fe1bff315d7feea93c5380","observation_id":"f9a8542b-6230-4250-8118-0efbd9f7f5e6","resolution":{"observed_at":"2026-08-06T16:18:53.307232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.02717","last_updated":"2021-03-03T22:05:24Z","snapshot_observed_at":"2026-07-06T10:46:40.459336Z","submitted_at":"2021-03-03T22:05:24Z","title":"Uncertainty in Self-Adaptive Systems: A Research Community Perspective","version":1},"cited_work":{"arxiv_id":"2103.02717","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.02717","snapshot_observed_at":"2026-08-06T16:19:05.590355Z","title":"Uncertainty in Self-Adaptive Systems: A Research Community Perspective","venue":"cs.SE","work_id":"f68e20c3-f9a0-4a62-97ca-c5e1214f3f16","year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.394976Z"},"links":{"cited_paper":"/paper/2103.02717","citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:01e1bf5fe400e5557af87db682e024282fe37de73d80db87882da00c71721463","observation_id":"19f505fc-5681-42f2-a252-0a0fe1540be6","resolution":{"observed_at":"2026-08-06T16:19:05.817326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.82582","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:05.265252Z","title":"o rl, Daniel M \\","venue":null,"work_id":"15f38582-2445-49d6-9e52-2123223656ab","year":2017},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.515461Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:598bbfe23313237dc5fa4be16f584fb2b988f0e218aadc245236f7ac4595d878","observation_id":"d501fa8c-e994-4810-bb39-d0822030c526","resolution":{"observed_at":"2026-08-06T16:19:05.372021Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:53.618032Z","title":"Reducing Ambiguity in Json Schema Discovery","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.618032Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:dd713f7509b84ba90decb53b036bf3459a76276a0c6649c3ffe3ed47687c1ffb","observation_id":"bd54e1f3-ac28-414f-bec4-0f4089822d44","resolution":{"observed_at":"2026-08-06T16:18:53.618032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11227","last_updated":"2024-06-17T05:50:46Z","snapshot_observed_at":"2026-08-03T20:30:37.498851Z","submitted_at":"2024-06-17T05:50:46Z","title":"Compound Schema Registry","version":1},"cited_work":{"arxiv_id":"2406.11227","doi":"10.48550/arxiv.2406.11227","metadata_source":"pith","pith_arxiv_id":"2406.11227","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"Compound Schema Registry","venue":"cs.DB","work_id":"8dbd87a3-210f-40e8-854a-f77a7e532dcb","year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.728233Z"},"links":{"cited_paper":"/paper/2406.11227","citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:6c6ab6ea033ed1fde433d85ef2d11b3070885d64ad13e3547f4b715a1d89f6b0","observation_id":"cc023766-9ba6-4736-9a96-97523abe85c6","resolution":{"observed_at":"2026-08-06T16:18:58.158162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.27045","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:04.683347Z","title":"Control-Theoretical Software Adaptation: A Systematic Literature Review","venue":null,"work_id":"1062663a-03fc-48ab-a938-8473342cf30d","year":2018},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.848631Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:685e57269a0596f7e04e17ffae9fc6b045cca66ca6b6195d824f4454ca353491","observation_id":"5f1b989c-ee61-48d2-8700-aad06d443bbc","resolution":{"observed_at":"2026-08-06T16:19:04.830517Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:53.988696Z","title":"Agent-Driven Automatic Software Improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.988696Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:83adc3315b493527a6183e9df659a3b765f7b64fea4e279e8f6092b613d1c8dc","observation_id":"3c3c7c93-03a1-4970-aec4-37e1c74d5afc","resolution":{"observed_at":"2026-08-06T16:18:53.988696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11390-013-1321-9","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:57.806049Z","title":"Fuzzy Self-Adaptation of Mission-Critical Software Under Uncertainty","venue":null,"work_id":"b2fa5849-076b-4d70-baaa-d117d97251c8","year":2013},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.119601Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:d79fefbcffda8bc1f21dc38a2a203cee5c682bce1588254edbc54c099704d5f9","observation_id":"e8520fca-c0d0-4a57-a1de-d85f9eb9c93f","resolution":{"observed_at":"2026-08-06T16:18:57.904811Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:11.214524Z","title":"Towards Evolution Capabilities in Data Pipelines","venue":null,"work_id":"41db49b1-1d6f-4fad-9628-d79a28611529","year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.233017Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:0c9ecc701c3339975ad81d53c284180b255dee9851d2fd2e44ec8cd523aef6e6","observation_id":"c91df8ca-20af-444e-affa-bedb5c32f194","resolution":{"observed_at":"2026-08-06T16:19:11.363646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9502.29395","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:04.106158Z","title":"Franklin, and Eugene Wu","venue":null,"work_id":"45433a83-3e67-444d-b6c4-5447edd69559","year":2016},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.357710Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:3651d32c26b2a696b7471487c3619855a0bacb9c6cd95ae7af5bd4d8945afb39","observation_id":"b344b8bf-e27e-4ee2-b61f-720684b7cf4a","resolution":{"observed_at":"2026-08-06T16:19:04.319031Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06439","last_updated":"2021-12-13T06:40:05Z","snapshot_observed_at":"2026-07-06T12:17:56.147137Z","submitted_at":"2021-12-13T06:40:05Z","title":"What can Data-Centric AI Learn from Data and ML Engineering?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06439","snapshot_observed_at":"2026-08-06T16:18:54.488535Z","title":"What can Data-Centric AI Learn from Data and ML Engineering? CoRR, abs/2112.06439, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.488535Z"},"links":{"cited_paper":"/paper/2112.06439","citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c3271f90507319a70537f51ce268b168ef577c5f19afb2df89531f5549e0cb91","observation_id":"50879f76-1b1d-42c5-a417-e1546ed087d2","resolution":{"observed_at":"2026-08-06T16:18:54.488535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-39355-6_8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Johnson, Gyorgy Simon, and Constantin Aliferis","venue":"Health informatics","work_id":"416a2409-d88a-4f6c-9d0c-2f3c24b6ea31","year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.611345Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:0fa3edd7e819f4ea58feb599385950e72f534d1db290d09f0beda4094e5a1e20","observation_id":"a1b91f72-aa9d-432f-87f9-0d660be4d2a9","resolution":{"observed_at":"2026-08-06T16:18:57.638807Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:54.737601Z","title":"Towards an End-to-End Data Quality Optimizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.737601Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:5e2dd2ff29e7549210e85e01113060a5fbacfa8d9d671798c275d77de9f88531","observation_id":"9cc6aeb6-19c9-4e29-b701-4dad951ee39b","resolution":{"observed_at":"2026-08-06T16:18:54.737601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10115-022-01661-0","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:57.244904Z","title":"Empirical comparison of supervised learning techniques for missing value imputation","venue":null,"work_id":"3b524355-5709-47cd-a8d8-1068571869da","year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.844195Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:843298c12dbec35fec6e1d696b7e3224339d44487502822f578e2e26936e1338","observation_id":"2ee479b9-5cd2-476b-ba0d-d295106e6bab","resolution":{"observed_at":"2026-08-06T16:18:57.388212Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:10.901417Z","title":"Kamrul Hasan, Md","venue":null,"work_id":"161e1225-220f-426a-949d-795b24f28993","year":2010},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.950468Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:d0d67fd1d35e9e6899247bb1709a81a0186342c0f0143aa3e1a6d14053c5542a","observation_id":"731f060b-0590-4b7f-aafc-8e9ec9c40b4f","resolution":{"observed_at":"2026-08-06T16:19:11.042201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18420/btw2025-125","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:56.953141Z","title":"o rl. ALPINE: Abstract Language for Pipeline Integration and Execution . In BTW Workshops , volume P-363 of LNI , pages 207--217. Gesellschaft f \\","venue":null,"work_id":"eae597c2-2bf1-475a-b050-f9a3484a2851","year":2025},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:55.088711Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:57dd16c72eeafe9f500d4dfd437be3b5bf5bb41773a9981dfb418693c9cc2476","observation_id":"b9c52985-0620-405f-ae9e-a10a504d9556","resolution":{"observed_at":"2026-08-06T16:18:57.067167Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:10.561162Z","title":"Towards machine learning-aware data validation","venue":null,"work_id":"a7bb8f02-c32c-4e38-9719-44967601bfd2","year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:55.236087Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:a3b042244130468ca4d32b99d3b890ef4b862ecabe53c00f9f703fa3b19d42dc","observation_id":"1ae8f269-34d4-4061-b9a5-93adc9d603d5","resolution":{"observed_at":"2026-08-06T16:19:10.717533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:55.385634Z","title":"Transparent Data Preprocessing for Machine Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:55.385634Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:9ae525b80a0b51f1cf10b3e48127721f1a7d17ab58d07248e312c03d31685cd0","observation_id":"9b410dab-750d-48a3-88d6-ff4df8bc98ae","resolution":{"observed_at":"2026-08-06T16:18:55.385634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:55.567021Z","title":"Breunig, Hans - Peter Kriegel, Raymond T","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:55.567021Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:9295271e389fb87277f0636dce96176605eeebad3881e02814cf099c34e8f5d1","observation_id":"a1450a14-2a19-4bd4-8b1f-591e679e4fd9","resolution":{"observed_at":"2026-08-06T16:18:55.567021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:10.143028Z","title":"Kramer, Valerie Restat, and Uta St \\\" o rl","venue":null,"work_id":"b1529543-387c-4e2d-89f6-ad43336bdf4e","year":2025},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:55.716135Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:6e6a7e35c95b78da59e4fecbd91a228a192f19fb23c14b9eb546793522cc9421","observation_id":"27cf353c-c40b-48ac-a0fd-876777397731","resolution":{"observed_at":"2026-08-06T16:19:10.323257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.11600","last_updated":"2020-03-25T19:47:30Z","snapshot_observed_at":"2026-08-06T19:44:28.339019Z","submitted_at":"2020-03-25T19:47:30Z","title":"Birefringent Graphene Oxide Liquid Crystals in Micro-channels for Optical Switch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.11600","snapshot_observed_at":"2026-08-06T16:18:55.852431Z","title":"Kephart and David M","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:55.852431Z"},"links":{"cited_paper":"/paper/2003.11600","citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:f1da4346cb827b92202d2006bf8ebde62816d061f416007da8f8b97d317f7827","observation_id":"d1285b19-8c7e-4616-840f-2648b49ec632","resolution":{"observed_at":"2026-08-06T16:18:55.852431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:09.875824Z","title":"A Survey on Application of Knowledge Graph","venue":null,"work_id":"cf2a5871-4c21-4abe-a892-4b6a93c528ce","year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:56.007444Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:5b069c2f9505d43144c01bd3784f2190a029fe5c00fe42ebb74be52b1cf5fe14","observation_id":"32b2fe69-75f1-40ac-be31-ae15b4200396","resolution":{"observed_at":"2026-08-06T16:19:10.001582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03286","last_updated":"2024-07-03T17:17:37Z","snapshot_observed_at":"2026-08-03T00:04:52.103306Z","submitted_at":"2024-07-03T17:17:37Z","title":"Large Language Models for JSON Schema Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03286","snapshot_observed_at":"2026-08-06T16:18:56.176603Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:56.176603Z"},"links":{"cited_paper":"/paper/2407.03286","citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:fc12e212acee5f322fc919ea341880526d2593d72214ac8c39944bcb4f9fc41c","observation_id":"5f63074e-964a-48ff-83f4-1b6bedd8688f","resolution":{"observed_at":"2026-08-06T16:18:56.176603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-87568-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Towards Taming the Adaptivity Problem - Formalizing Poly-/MultiStore Topology Descriptions","venue":"Communications in computer and information science","work_id":"6e4b79e8-f6ca-4227-a372-0e6fda226f13","year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:56.330463Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:202c8dc34c700f5da9c4c333df44064e305d6589c09a3274bff3d1ad3720c6f8","observation_id":"c03459ec-e8f2-4420-8aa6-d1b8f5322618","resolution":{"observed_at":"2026-08-06T16:18:56.803394Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:09.613474Z","title":"Schema Extraction and Structural Outlier Detection for JSON-based NoSQL Data Stores","venue":null,"work_id":"3c828ee4-bc4e-44d2-a50b-8b15efa2accf","year":2015},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:56.509967Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:855bf58f68615b25126a736140d864a813f7873b76511563e3ab6daa97b7f859","observation_id":"d4010b8f-901c-4870-80f6-ed1a887dfc07","resolution":{"observed_at":"2026-08-06T16:19:09.753709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","latest_version":2,"primary_category":"cs.DB","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":38,"verified_exact":24,"verified_fuzzy":13},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2507.13892."}