{"as_of":"2026-08-14T02:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:506ae065e3f5d54f08e9b3d01f279c62315b1cafe8a3d24960c59a4e8364e1e7","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T03:44:09.309934Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09345/citation-record","integrity":"/paper/2607.09345/integrity","json":"/paper/2607.09345/citation-record.json","paper":"/paper/2607.09345"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Cost of flaky tests in con- tinuous integration: An industrial case study,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:1acb329ee709e527f99efede511d565fa8ee12342da31977a041a9959065fd07","observation_id":"35f1b600-ef73-4abe-815a-5e866ab5b649","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Understanding flaky tests: the developer’s perspective,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:895b109ed4092496d66804af131d8014e261617c898a869ef2374f9a792dc582","observation_id":"a364c06d-d03d-4f3c-8a4f-786c3c99a8a2","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Presubmit rescue: Auto- matically ignoring flakytest executions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:d1fd4a8b0f039c123143e5487d7625b73cb81bb2cf2a4bbee1c6ff7f00f0facc","observation_id":"249adf12-6335-433b-8a41-64abd9f4ea21","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Software testing research challenges: An industrial perspective,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:26e714b4714e380ee0eaecfc824e02241ec123315c2bda61ea1c7617c990c3c4","observation_id":"fa1e577d-2a89-4a17-8755-b203ef777c27","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Taming google- scale continuous testing,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:4142e271883e6dfc43ebf3b56ccb38095a13510785d187fe4fc8f96735cd95df","observation_id":"8fd654f6-c36b-49f7-9521-a8661c104f1f","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Do test and environ- mental complexity increase flakiness? an empirical study of SAP HANA,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:511cfd198573ffe48cbabb13ac7955b055d76a65df0905e0e9ea782c2c0af311","observation_id":"985d93c2-48d6-4677-b563-74707cb3f438","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Modeling and ranking flaky tests at apple,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:7609c9d534dcee3c39361030c1a91b44bac3305157b8d1ebb64e8f153714c207","observation_id":"cf053f66-d9d2-49eb-9891-1e176fede54a","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Empirically detecting false test alarms using association rules,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:cd9c394269fe63d534c5ac60f537b37f8e9a6f0c2f9371e5fc3f4520a4489553","observation_id":"320a3b22-2c90-4bdf-bcff-f035ea343952","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Toward static test flakiness prediction: a feasibility study,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:cab0271e1b465f435364476d00f46c5d16ee869493abf6f293bfafeb79f81542","observation_id":"e149449f-0449-4002-be10-0d40e1e16e2b","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Deepflaky: Deep hybrid representation learning for flaky test prediction,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:4db0c067ddf21b3c4dfd0a933964e3d6c0a94dd4fb883b8d09ee908199693865","observation_id":"932fe7bb-056e-451b-b165-357fbb0640de","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"What is the vocabulary of flaky tests?","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:d90aba39fbe62f2aade4ab4cdfb4ea723f7b47700cc18873e41a5268345ee446","observation_id":"653960b7-6c2e-4d80-ae1c-7ee4027d0f5f","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"A replication study on the usability of code vocabulary in predicting flaky tests,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:892602f8f7dc7221efee3ef8162e23d73edb1970211cf8dd697a195fa668b2b3","observation_id":"c92449ab-5664-46c0-8664-5ec350e5e278","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"The vocabulary of flaky tests in the context of SAP HANA,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:13cb5b47b282de9a3950a63615dc04a182a3806f4d3cfe02d032fd12eaa0e77c","observation_id":"6e66754c-32ba-4733-bf17-a4e67623cd6c","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"A preliminary study on the vocabulary of flaky tests in swift,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:6bca180bf7fc228e094de7d5203fc5ec3215df3dc8acf4802c414d2f79616ec7","observation_id":"fd337723-3d97-49b2-89b0-7e7a45a63256","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Flakeflagger: Predicting flakiness without rerunning tests,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:bac8bd32ba1e5f3f5cf5d43cdadcb9071b562b0873d1b762b6b7a3f86948d53f","observation_id":"447fca39-5b59-419f-ba88-f5f20b41206e","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Flakify: A black-box, language model-based predictor for flaky tests,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:0473f964f3331d0780f11044906ff0fc6b75ddf7d1c240c33d21bf93fc7add78","observation_id":"188885a3-5bd9-4068-a7ba-f7237d1a09bd","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Understanding and improving flaky test classification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:b6e28bd89ab319e3394e1f4759acc216c8392c082b9817d7aaf5e8a3dde43f60","observation_id":"f8f2673b-220a-4f71-9eab-8b31c111d2d9","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"An analysis of LLM fine- tuning and few-shot learning for flaky test detection and classification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:2327866c3f6dcec757993d7913704ce3af1d8a1ed6e551f7280dbbafe8db5e99","observation_id":"337e1a26-7e85-4b7e-9ddd-bbbf24251761","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Can we classify flaky tests using only test code? an LLM-based empirical study,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:6eeb7073c0687f5df73dfe1b7cca609cd7c14bfb588608c98c392b40bcd1612a","observation_id":"3b622059-0293-4a95-ba71-f33dd5ab484a","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"The importance of accounting for execution failures when predicting test flakiness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:dc97219628c6632089dd49cb3cdc141d557829995a06ec82c791bba9f1407279","observation_id":"a7c64214-c438-4825-b8b7-15c23ccfe9b2","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Quan- tizing large-language models for predicting flaky tests,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:8518dab2681bd8be68d79ce73868c580ed5e1aa202c498d04815a7b2b575970f","observation_id":"0dab7a53-1f1a-41a7-9026-df029c127e91","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection (Research Arti- fact),","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:7e2be23113f6a8725128d4b94390d3738967400de1a4ba4ea41c9201fab3314c","observation_id":"33aa6fc8-3dc0-44fc-90fc-6e0601436bf3","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"A survey of flaky tests,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:3abe23e4ee5f10ee0a853c8666ceca03cb021511d0ab9889d98a793cbc991368","observation_id":"dff90142-cb36-4188-97b6-3a681f69ffe4","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Know you neighbor: Fast static prediction of test flaki- ness,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:b79bf7920394270979d78b637ec12153ab2dbb81411ee0e952c84513f8dd447b","observation_id":"fbe62dad-abef-480c-bab5-9a167c10bfac","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"What is the vocabulary of flaky tests? an extended replication,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:9fcc4b484001803bfb328dcd07f7629407f45da3f67a7cae69ac9cb0d5488820","observation_id":"a920b50b-617d-497f-8411-844bcd25a805","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Flakyfix: Using large language models for predicting flaky test fix categories and test code repair,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:a8e719aaebb9f4f998aa0d989d344f9b96ad3c15d14ed07a913371238efa0597","observation_id":"4b9749b0-9315-498e-a1da-6a49cb935af0","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Deflaker: automatically detecting flaky tests,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:44322716e962a937707ccf70a583d2f2fc52d06ebdbca564bc65d64301ba085b","observation_id":"0c7809d6-f4e2-47e5-a534-a760ef6482f7","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"International Dataset of Flaky Tests (IDoFT),","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:e9b31524da081019b629e818895dcca0ba05669fb48b26412040be47c08808a1","observation_id":"5d2e3b27-165f-49a2-840d-42c7b64ed179","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"iDFlakies: A framework for detecting and partially classifying flaky tests,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:13f8fc67affbbd895db8c75c53aaaa746b1b2d57937b5f3f92f654cdb5cb117b","observation_id":"63cd649e-797c-4526-b93f-0d7177ec417e","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"FlakyCat: Predicting flaky tests categories using few-shot learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:d75bbaca995e032c90dc4b790cb2ecb532bfb795ff3f400385b2edc3614dfc52","observation_id":"ddc4e676-9293-468f-979a-b1b43a9069d1","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"An empirical analysis of flaky tests,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:150618aceb9744c29cecb82f28f2f4312e3c3bfb97fed757ad20aa8440e70ff7","observation_id":"2e85fd5b-fe6c-474f-932e-ff343bb1d194","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Code- bert: A pre-trained model for programming and natural languages,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:870d629dc8ff811c02fab65199df37e81d0f07301b25c026053b1f2d2b02f90e","observation_id":"8cabcc50-2ff0-4f26-b13b-5b714a2fc98b","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"1536–1547","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:f3245c3e18b5fd6a8d995c055abe778f82eccb6f5f50271a160c484ffbf09451","observation_id":"7bd05fc8-84f4-42da-a3e3-1b16f31b9b0b","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Artifact Review and Badging — Current,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:3ace6e7fe9de7d05709a2ba84831ad7aae7c8d74a34a8a673ec251a95c2bb714","observation_id":"e5a3178a-5585-43dc-af30-2f000588ab2c","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Do automatic test generation tools generate flaky tests?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:e486f1da699bda13f9ec9f0b7dbef763fb8881fc82a82ac0c768843656dfc789","observation_id":"d96af790-e0da-43a8-b0c8-af892076631f","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"On the flakiness of llm-generated tests for industrial and open-source database management systems,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:e54aec176dcd077587b0e30c6193db0de3762a0f1681bb1f3c181b0b3f1097ed","observation_id":"a9fb5459-07aa-4225-826b-14ed90be5581","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Research on test flakiness: from unit to system testing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:66ea5d39d05bc2a2d639c7edc22c0a62d8a30e6885d5bf0e6fdffdbf9815aaf6","observation_id":"5b149215-c516-4f00-8dd7-d62925b3ea3c","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Taming timeout flakiness: An empirical study of SAP HANA,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:1d749e3c52711116eb3b18d3895e30f5ef60601daeae0264e9cf1547a4cb6b13","observation_id":"f50aca27-7108-45cc-93a6-5230174ce788","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"An empirical study of flaky tests in javascript,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:1fd0e8b7f29a373b8f4ed70680ee43b2094e868d5a0cdff16b7df5f87af9dd01","observation_id":"a4b7c34f-5458-4ef1-835a-50b304ef27af","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"An empirical analysis of ui-based flaky tests,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:a050741a993960b09b29be28cd39513577505c22efa0082ea1d9c4b6a0f9a3b9","observation_id":"6586200a-fe5d-41b5-abdd-33a4462f42ac","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Empirical study of restarted and flaky builds on travis CI,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:58dda3849b77447e9130a435f0883c26125e59f3dd1b5245496d3c02bc4b9dee","observation_id":"bf4b9ef1-0b87-4cb4-8077-798a7e59164e","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11245","last_updated":"2021-02-22T18:30:15Z","snapshot_observed_at":"2026-08-09T15:58:46.603171Z","submitted_at":"2021-02-22T18:30:15Z","title":"Silent Data Corruptions at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.11245","snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Silent data corruptions at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"cited_paper":"/paper/2102.11245","citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:ff2d9cf3e00a996616646a663e3121fe40fa9873f2a7767898d9fb84f4d37398","observation_id":"43b57728-01a8-46b1-8271-516d675de8c5","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"The relationship between precision-recall and ROC curves,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:9949f7a351a7f19436e63f4b9217dc588e9de6e3e9ff625851141f6654ce8c1b","observation_id":"d4c04aff-0a0d-451f-b8ef-a96c47e38b93","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"A container- based infrastructure for fuzzy-driven root causing of flaky tests,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:3d082b191f1d49ed482a0dbb1fbc4785bad6701b667efaec2ee48e75a794f6c0","observation_id":"c90449d5-6d26-49d0-924e-3f1e731eedb2","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Research Design and Issues of Validity,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:10b8f5306e233a730cfbd0ad81245bad6307f633198c2554b4839a306e792fc3","observation_id":"01750898-6a87-444b-9b2a-bc737e6f3376","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"The effects of computational resources on flaky tests,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:e004a1aa606ef9501bb0c0321cdb81fb964c551d1f34b25382ec8fd6e70d4d17","observation_id":"63989574-2ac8-4068-9860-c2675bee940f","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Sampling in software engineer- ing research: a critical review and guidelines,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:733e91af89dbfdbbffd7cbb2692b7f5423ee6276d562c619088ad5b554823159","observation_id":"e5887f38-c057-4f3d-b6ca-3ba399213365","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Wohlin, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:0f593579a6afb73a2607eecf9bb4037cbffa26a6d96a82a91edb19e565bc0fe9","observation_id":"650607dc-5645-4858-8d6d-68be2686acf8","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Construct validity in software engineering research and software metrics,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:a8fc8901f9a94efbcd73d90d4bbe32ea28d0b78b2f7b4e28e25c813a136033b9","observation_id":"57504701-29c0-4317-ad0a-8c4ca5dc215c","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Deep learning based vulnerability detection: Are we there yet?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:eb68e6caf398d4ca55accaaa145fe11d2ef9382b954009b449c90f5ed631aee5","observation_id":"40760ba1-5137-4958-9594-00fd692278c5","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Root causing flaky tests in a large-scale industrial setting,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:5b9eed94925659861c805ed00de0c7853a7721ff2284a6294dd05b84cbcf8e28","observation_id":"efa8dde8-0a6e-4620-a32b-4b90548465a1","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"A survey on how test flakiness affects developers and what support they need to address it,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:f37e034ccc04ac6088f6c73bba499e7002c70167aa295e15eab2fabe88ff2521","observation_id":"9ace7ba1-34db-4c41-96c2-b1c3f23a7ef6","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"230,439 test failures later: An empirical evaluation of flaky failure classifiers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:187aa14028f554fc0d9f0e212140ed37d258150832dee774b56e4826c0fc6354","observation_id":"49b80d18-50ff-45cb-b2cd-f44416d40d90","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"Just-in- time flaky test detection via abstracted failure symptom matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:6985cf84f8a685c180a16f81b20cb0920e2b9dd2622b753b4d463999c2424861","observation_id":"fd918eb7-c3f4-4a85-ad88-c620a077bab4","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"When life gives you oranges: detecting and diagnosing intermittent job failures at mozilla,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:3a5e8b719d1d0fbc09a711ed65ccaee5e6a60e681d8b34493db11d3c2e19efe9","observation_id":"a06f50f4-ef5a-4a62-919d-dcd2d2f7bdec","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:44:09.309934Z","title":"On the diagnosis of flaky job failures: Understanding and prior- itizing failure categories,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T03:44:09.309934Z"},"links":{"citing_paper":"/paper/2607.09345"},"observation_digest":"sha256:02ad291a17bb72e1236775cf004ff5582fd6b9714ab5754d7b6acf4a09bafeff","observation_id":"a807e333-3b7d-466c-8a18-0b5c19998510","resolution":{"observed_at":"2026-07-13T03:44:09.309934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09345","last_updated":"2026-07-10T12:24:25Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-13T07:04:22.593824Z","submitted_at":"2026-07-10T12:24:25Z","title":"How Far Are We from Detecting Flaky Tests? On the Limits of Code-Based Detection"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2607.09345."}