{"as_of":"2026-08-07T16:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fef2a4406ebe555db807e35cf8f29caa194bc9bfb8e2d58eb0b0b72854ed1e16","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:46:42.222982Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04687/citation-record","integrity":"/paper/2507.04687/integrity","json":"/paper/2507.04687/citation-record.json","paper":"/paper/2507.04687"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:50.319601Z","title":"Elsevier, 2012","venue":null,"work_id":"b9fda18c-65fb-4df8-9343-20c8062015cc","year":2012},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:38.595953Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:1a64a0c4a3b8d504b224e41a174031c3446c0a80929ee1b2c732ae80d5735f61","observation_id":"337ca480-dd88-448e-ad72-76c62958689d","resolution":{"observed_at":"2026-08-06T19:46:50.409598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:50.121096Z","title":"Methods of integrating data to uncover genotype–phenotype interactions.Nature Reviews Genetics, 16(2):85–97, 2015","venue":null,"work_id":"b256f04a-9a19-4059-a08f-c8c4fef73931","year":2015},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:38.645559Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:6a1843c6b815dba2f512c2f85930b9a5991015878aa27639d7e02904d9f781db","observation_id":"9c51b48d-a157-4214-a5f8-8bbf29c691c8","resolution":{"observed_at":"2026-08-06T19:46:50.224581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:49.928308Z","title":"Efficient joinable table discovery in data lakes: A high-dimensional similarity-based approach","venue":null,"work_id":"46bbc41b-951d-484b-ae7b-7f2fa05d3a4f","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:38.720279Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:6eb799a96b6efbeab9b5b34dd9e17b5b2ee5fb64e3af9e576a9dd24001fe303f","observation_id":"96c9b145-c82f-402c-b884-162db2a85863","resolution":{"observed_at":"2026-08-06T19:46:50.026779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:49.734892Z","title":"Semantics-aware dataset discovery from data lakes with contextualized column-based representation learning.PVLDB, 2023","venue":null,"work_id":"6d6e9d06-80f4-4066-b525-a37c41a756ff","year":2023},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:38.782069Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:6005e4a4571e5afb173fc017a37e3cbe76c97ffe7e3fbeef35c6400689450635","observation_id":"650a923a-0509-4fd9-bea3-2f78ce0ed162","resolution":{"observed_at":"2026-08-06T19:46:49.824503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:49.556042Z","title":"Rosenthal","venue":null,"work_id":"e841038f-35f9-44d4-be60-34ad7bf95d21","year":2007},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:38.864316Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:123d80ac4b2bb8c7c50806359d9b4136e8af29ae91c4d3742b2f8ed5b26aa2b2","observation_id":"45a2b0e0-7a8f-4e77-b801-df5a0b27a8e6","resolution":{"observed_at":"2026-08-06T19:46:49.642134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:49.420882Z","title":"Valentine: Evaluating matching techniques for dataset discovery","venue":null,"work_id":"c92f3880-ea07-4de0-aa41-410d2e0579f8","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:38.933152Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:95167fcfa2b742b0b7e6a07cde3b88f933d35281314e996fcdfd9c96c3e67141","observation_id":"0780ed56-de8f-4da4-9afb-4bb7a1115e32","resolution":{"observed_at":"2026-08-06T19:46:49.482221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:49.222698Z","title":"Table union search on open data","venue":null,"work_id":"f87f0f03-13e7-4333-9011-9fa5d897d5a6","year":2018},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.022395Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:75955de891df51cc8279836adc4dacf3f0466073a3b811330f79b6fde2252278","observation_id":"75a00a98-a892-4963-b6b2-a20f06ed0068","resolution":{"observed_at":"2026-08-06T19:46:49.318760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07258","last_updated":"2023-04-12T13:24:55Z","snapshot_observed_at":"2026-08-06T09:12:18.545184Z","submitted_at":"2021-06-14T09:22:09Z","title":"GitTables: A Large-Scale Corpus of Relational Tables","version":5},"cited_work":{"arxiv_id":"2106.07258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.07258","snapshot_observed_at":"2026-08-06T19:46:42.796080Z","title":"GitTables: A Large-Scale Corpus of Relational Tables","venue":"cs.DB","work_id":"b5235787-2945-4704-81b6-cfdf6e0efec2","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.120703Z"},"links":{"cited_paper":"/paper/2106.07258","citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:e77f7d3b865b78a45c207e0d4a4525c51e85bbd7549e54bad5a77311b4260c23","observation_id":"4b00f74a-ccce-422a-92a8-a565f510056b","resolution":{"observed_at":"2026-08-06T19:46:42.890225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:49.037802Z","title":"TPC-DI: The first industry benchmark for data integration","venue":null,"work_id":"86ce3b28-a55c-4788-86a0-5bf49e38ea4a","year":2014},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.173905Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:84b30b8ebe691a6186a968e5a50bca653e5eda458ff885c05bc76a839088d74b","observation_id":"49028a64-ef2b-4a64-81c6-76178d7ec822","resolution":{"observed_at":"2026-08-06T19:46:49.125604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:39.236042Z","title":"Chembl: a large-scale bioactivity database for drug discovery.Nucleic acids research, 40(D1):D1100– D1107, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.236042Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:07a8ba3d30e9505ad7e36d163b1d0910484b63a7e106b84dff4899bd637a6763","observation_id":"aa467c42-0294-4e0f-9812-9a1dd64662f1","resolution":{"observed_at":"2026-08-06T19:46:39.236042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:48.849407Z","title":"C., Chaitanya Gokhale, Pradap Konda, Yash Govind, and Derek Paulsen","venue":null,"work_id":"7f7e3e32-3e4a-4dee-b28e-cf38a48484f7","year":null},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.302163Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:738a11394a9abf0087c3085d352adefab54a6737836d2c0528f50a705978d46d","observation_id":"57d2744d-e8c1-4849-8bb3-f85a1f0a8507","resolution":{"observed_at":"2026-08-06T19:46:48.946488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:48.656687Z","title":"Snomed-ct: The advanced terminology and coding system for ehealth","venue":null,"work_id":"66fd26f4-6317-47a2-b741-6422c8981504","year":2006},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.347667Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:a59347fdf169bfbafd6a469cb850aed255ba9ee23580f468c4b8edec30b9b7b8","observation_id":"d55a9d0a-c3eb-48cd-99ee-ff1a18c6e897","resolution":{"observed_at":"2026-08-06T19:46:48.741560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:48.501676Z","title":"The making of tpc-ds","venue":null,"work_id":"9c60dbd0-7c31-45fb-887f-c6a59434b6d6","year":2006},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.417269Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:432853f85d6c6f8578841c0e94ae32a0516f4e04eb7e97629b0d9feb05a6874c","observation_id":"3f32be8b-2d3b-434d-a22f-56ae5e46e621","resolution":{"observed_at":"2026-08-06T19:46:48.565726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:39.501733Z","title":"Synthetic data generation for tabular health records: A systematic review.Neurocomputing, 493:28–45, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.501733Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:34fd06ea8e4a1ec037c11d6ffeb706d46fa252ddc88cf61556e897d8fccf051a","observation_id":"cab24634-ef3c-4f1b-af7c-2b7941f4183d","resolution":{"observed_at":"2026-08-06T19:46:39.501733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:48.338044Z","title":"Language models are realistic tabular data generators, 2023","venue":null,"work_id":"892bb9c2-5c97-44f3-9100-528e5d71d30c","year":2023},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.567490Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:6c77cc4620cbba5a9fbe0151092c45d320a09603aa48b2a00194f2f6749a6f34","observation_id":"641e7c3f-cf91-40ce-9e35-47e36155955e","resolution":{"observed_at":"2026-08-06T19:46:48.419360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:48.151818Z","title":null,"venue":null,"work_id":"d7294938-7368-4a73-8f78-51b5c68fe30f","year":2019},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.649660Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:c2beb40c8de3d72a53591b3252d69c8c1ac35c472bfc92461e973a065a7be8ec","observation_id":"e6c5ebb3-4060-4b71-8bc9-0bead5d7dbd7","resolution":{"observed_at":"2026-08-06T19:46:48.218891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:47.985060Z","title":"The financial industry business ontology: Best practice for big data.Journal of Banking Regulation, 14(3-4):255–268, 2013","venue":null,"work_id":"a118f811-4e65-4a64-bdf3-bc90622abc77","year":2013},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.706577Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:6ebce193d25b9e55b17cd523d16c147a6471e3410124fa4a41e2fb3ec36e52ee","observation_id":"bbf2f4fe-db4a-4f6a-8bfa-6ee40d839b7d","resolution":{"observed_at":"2026-08-06T19:46:48.056567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:47.850719Z","title":"A survey of approaches to automatic schema matching","venue":null,"work_id":"652247ff-d48e-4f79-94fb-dcdbb079246d","year":2001},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.787516Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:cf8f2d202b51eb727b8241ac641c07929fbfe6ee3e52b5c8dc85a5d189b4c1aa","observation_id":"3746e272-56fa-44c5-91b6-39e8e2cc8d8c","resolution":{"observed_at":"2026-08-06T19:46:47.915906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:47.688625Z","title":"The gene ontology (go) database and informatics resource.Nucleic acids research, 32(suppl_1):D258–D261, 2004","venue":null,"work_id":"b7d159db-066f-45a9-b79b-84da8ccdb848","year":2004},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.851571Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:fd020756a7b3b69e23f1fe6d614d6194ecba23585fb756b9d5e15de0b40a079e","observation_id":"c3b24c92-6f06-4832-bd50-cdc621c64b63","resolution":{"observed_at":"2026-08-06T19:46:47.759516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:47.467460Z","title":"Building a drug ontology based on rxnorm and other sources.Journal of biomedical semantics, 4:1–9, 2013","venue":null,"work_id":"1fad5266-58bc-4c7d-acda-8a29187647fb","year":2013},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.914870Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:0e31f7e7eadf002922b0cd6d808da1e817aa929a852e829056604e5f0c7bf8b5","observation_id":"6a2725aa-e419-4d1c-9893-1a1cc5c6e4b1","resolution":{"observed_at":"2026-08-06T19:46:47.570960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:47.336353Z","title":"Challenges and innovations in building a product knowledge graph","venue":null,"work_id":"47b5ed72-e739-4489-8ffe-f69195e50a2f","year":2018},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.999143Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:3bdc18f5099f132f4e8e9f8936bcce4f7725fb0e653512af095452571ecf9442","observation_id":"f999bc2d-c5f2-4b30-ace0-a05dc0ee35f7","resolution":{"observed_at":"2026-08-06T19:46:47.388707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:47.164113Z","title":"Owl web ontology language overview","venue":null,"work_id":"317e7742-1dfd-4c37-9afa-c5d232a906e2","year":2004},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.047649Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:e035e54f5f10057aa5cb373e8c113f18557464fcf7e0ba1609cecb222ed00d57","observation_id":"6fe9ace4-e603-44fd-bd99-a99abc0d0659","resolution":{"observed_at":"2026-08-06T19:46:47.252137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:46.998945Z","title":"Coma—a system for flexible combination of schema matching approaches","venue":null,"work_id":"47503631-ef1a-4afd-aa57-5dc964e99a82","year":2002},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.131147Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:6a1ac2a0ab8bc47a14c52987cbeafb8c7a9247c521c3afb0a9fde401d03b0996","observation_id":"ff7ecb10-3b4c-4741-98a6-56ddb0b8c4b6","resolution":{"observed_at":"2026-08-06T19:46:47.074969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:46.839586Z","title":"Drugbank 5.0: a major update to the drugbank database for 2018.Nucleic acids research, 46(D1):D1074–D1082, 2018","venue":null,"work_id":"3127a1ee-b1ef-421b-9b83-5c34b2019496","year":2018},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.198143Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:51b7ce2a7593b3142d2cf5752e8bb427ee2b489f0ec256f4c0653906c2fb889d","observation_id":"9f71637e-76ab-4fd1-9856-24cf79e5e16b","resolution":{"observed_at":"2026-08-06T19:46:46.922457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:40.260786Z","title":"Mimic-iii, a freely accessible critical care database.Scientific data, 3(1):1–9, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.260786Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:f215bf233433c80f532f9bfc5ab962f007bf6d0028337e069c86f72a16b77ffe","observation_id":"8d2683b9-ea0f-4fcb-b504-0d9c758d6816","resolution":{"observed_at":"2026-08-06T19:46:40.260786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:46.667707Z","title":"Mimic-iii clinical database demo (version 1.4).PhysioNet, 2019","venue":null,"work_id":"895ee5dc-b13b-4134-bb8e-ad0de51e833a","year":2019},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.312254Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:451882e8bf4b26b6aba830ef6f8f5179c6095246a0d2798805573e32218f0326","observation_id":"5aba2c4a-cfb2-4ec1-b8d9-62b5a329d36e","resolution":{"observed_at":"2026-08-06T19:46:46.747459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:46.398722Z","title":"Similarity flooding: A versatile graph matching algorithm and its application to schema matching","venue":null,"work_id":"99774700-e89b-4404-a092-83505c6b04f4","year":2002},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.364397Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:75e3ce2dc37c214d9247a673a09f21d91dccfc51f19002563b93efa4a78e677d","observation_id":"db218a45-5179-412e-8e43-f5bdfe4d1fb9","resolution":{"observed_at":"2026-08-06T19:46:46.536056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:46.154378Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":"98f26950-e45e-4498-b8b7-a2a102c33f09","year":2020},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.443165Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:1774218c9ca957647234f07db3d7f927bbec3a9989e9d4bf9fbd8a0d5f187de2","observation_id":"6eb207e2-0183-4765-9d70-05604111cba4","resolution":{"observed_at":"2026-08-06T19:46:46.268729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:45.994456Z","title":"Ad- versarial generation of natural language","venue":null,"work_id":"8eec3ba8-00c2-4bac-b333-100b354349a6","year":2017},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.509043Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:9e589af114599fee0ac7840e1ac05df775d33e65b7dd61c4d8bc12399deb8a61","observation_id":"c1be3a87-1992-4882-a6a8-6074023d1fdc","resolution":{"observed_at":"2026-08-06T19:46:46.075543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:45.722981Z","title":"Stewart, and Jimeng Sun","venue":null,"work_id":"92332707-1248-46dc-8db5-fa552a76e560","year":2017},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.555798Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:4b4740bc7230e9213cd37b82ff43bbdca5d6fc948bc406c7944e030b04049d5e","observation_id":"aa1be799-bf5f-4ed6-b984-99d4d9f55ea0","resolution":{"observed_at":"2026-08-06T19:46:45.812879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:40.629325Z","title":"Data synthesis based on generative adversarial networks.Proceedings of the VLDB Endowment, 11(10):1071–1083, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.629325Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:b2f930855c8ff05d53dde1e60885a4e409261c425a26667d71863014696a339c","observation_id":"3a4faebc-9667-42fb-b7e8-39907213c57b","resolution":{"observed_at":"2026-08-06T19:46:40.629325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06657","last_updated":"2018-07-17T20:22:15Z","snapshot_observed_at":"2026-07-06T06:50:48.184959Z","submitted_at":"2018-07-17T20:22:15Z","title":"Airline Passenger Name Record Generation using Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":"1807.06657","doi":null,"metadata_source":"pith","pith_arxiv_id":"1807.06657","snapshot_observed_at":"2026-08-06T19:46:42.560533Z","title":"Airline Passenger Name Record Generation using Generative Adversarial Networks","venue":"cs.LG","work_id":"aa73e1b3-3d05-415b-a130-65fa0836780b","year":2018},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.634331Z"},"links":{"cited_paper":"/paper/1807.06657","citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:ed7afdb255cf0e0b79707e9ea56777a397ac6502965cf09574f3c47a8c417c73","observation_id":"0c9ee4f6-e2b1-4572-8327-ec96a39e2b90","resolution":{"observed_at":"2026-08-06T19:46:42.682223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:45.444275Z","title":"Modeling tabular data using conditional gan","venue":null,"work_id":"d8656729-19cc-46db-b108-445b5e37f4d6","year":2019},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.731831Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:ac1d739417e831aa495b9b842fc75f081321b8751a15881895f7c77f5f42c6db","observation_id":"dc61ac8a-6a39-4418-a8f4-01f5a28bd7f7","resolution":{"observed_at":"2026-08-06T19:46:45.574677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:45.140687Z","title":"Synthetic minority oversampling of vital statistics data with generative adversarial networks.Journal of the American Medical Informatics Association, 27(11):1667–1674, 2020","venue":null,"work_id":"12967b0b-b100-4ef6-a9c7-501142d24bfd","year":2020},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.873680Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:4bb3305822cb627454cf676b9fac487789029791e32b70951101c884bb00f8d1","observation_id":"eb18418f-f164-4d02-bd4a-92f87d94c7ce","resolution":{"observed_at":"2026-08-06T19:46:45.279523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:44.861079Z","title":"Vaem: a deep generative model for heterogeneous mixed type data","venue":null,"work_id":"3f080477-a2a3-41aa-8f2a-b7c2f2a31bd8","year":2020},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.948983Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:a62320ced4417915ebbecc0df1a74332678791d3a75d355e5c83e5b4ab5d2845","observation_id":"5162ff48-412e-4edd-8619-984bcc90fe04","resolution":{"observed_at":"2026-08-06T19:46:44.978258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:44.572543Z","title":"Generating privacy-preserving synthetic tabular data using oblivious variational autoencoders","venue":null,"work_id":"ea1ea356-6f65-4a48-a475-c4dc55528198","year":2020},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.037192Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:66ebc229a9be5a7b708e762d249305979a3342ee2384f76d283782640277dfd6","observation_id":"59e88c8e-d7be-4997-a703-ffe9b8b2426c","resolution":{"observed_at":"2026-08-06T19:46:44.688347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:44.294807Z","title":"Synthesising multi-modal minority samples for tabular data,","venue":null,"work_id":"a18baf63-dbd0-4dec-ad42-0e281af3a087","year":null},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.164547Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:3914a9811c2d4b9dc9c3585df1eec8e967702b09e3e18ba647f27ad1add1c766","observation_id":"3d7b0abf-0037-4df8-9ce5-3dac71e2ff5d","resolution":{"observed_at":"2026-08-06T19:46:44.418972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:44.103684Z","title":"Tabnet: Attentive interpretable tabular learning","venue":null,"work_id":"f03a53f6-7bda-4a78-a2d6-daef008f1fb6","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.388122Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:1a2768f6e71cdb0a3b4eac753b2a3bba9d3620d76fcafdba8f8b4ee51e496d02","observation_id":"0553dfcb-ed37-4cfd-803e-29a2004ba0f2","resolution":{"observed_at":"2026-08-06T19:46:44.192549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:43.909047Z","title":"Saint: Improved neural networks for tabular data via row attention and contrastive pre-training,","venue":null,"work_id":"4116738c-5349-4041-a2e0-eec54db45eb4","year":null},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.503336Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:af694a1d9e462063475338b4f7b21d58bacf870dc91c22a80394bbe5abbce378","observation_id":"3f8d4c91-3f65-425b-a84f-7456084be414","resolution":{"observed_at":"2026-08-06T19:46:43.987059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:43.694077Z","title":"Self- attention between datapoints: Going beyond individual input-output pairs in deep learning","venue":null,"work_id":"e77ec49b-0c7c-4efa-8f08-30bb1730f817","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.747618Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:69a5428081855c4b29247ca33de33ac95cc1a7d6a13fdd92605f64368694fb4d","observation_id":"ed4bfe12-dcd4-4a37-9b3c-771d0c154dab","resolution":{"observed_at":"2026-08-06T19:46:43.793904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01342","last_updated":"2021-06-02T17:51:05Z","snapshot_observed_at":"2026-08-05T11:00:48.512556Z","submitted_at":"2021-06-02T17:51:05Z","title":"SAINT: Improved Neural Networks for Tabular Data via Row Attention and Contrastive Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01342","snapshot_observed_at":"2026-08-06T19:46:41.626833Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.626833Z"},"links":{"cited_paper":"/paper/2106.01342","citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:44be40eb60a075bab89549474634157e93a1ebbf58f3a758a1f9ef2a0c20188a","observation_id":"b79f17ec-2440-45e6-bdde-d000e72ff68a","resolution":{"observed_at":"2026-08-06T19:46:41.626833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:43.239112Z","title":"Tabular transformers for modeling multivariate time series","venue":null,"work_id":"a4ed8b4d-0c29-4682-a819-1b8fb4a50997","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.934788Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:1fc9f597fcef8f1899813ff753f898f33a1c730070daa29a9bcd5c957b3b133c","observation_id":"03501243-0857-4756-bb5b-978a2b8eea4c","resolution":{"observed_at":"2026-08-06T19:46:43.344964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:43.465761Z","title":"Tabert: Pretraining for joint understanding of textual and tabular data","venue":null,"work_id":"1b377e0c-4206-4520-b217-d6093486263d","year":2020},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.835438Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:3b4daff419d7594ea20f4766f5e957fad70ba5340e7481cbc050bf401ad2c519","observation_id":"373ab5d0-63d0-4003-b11a-0b2983f2d634","resolution":{"observed_at":"2026-08-06T19:46:43.572886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06280","last_updated":"2023-04-22T10:03:23Z","snapshot_observed_at":"2026-08-04T17:31:19.505383Z","submitted_at":"2022-10-12T15:03:28Z","title":"Language Models are Realistic Tabular Data Generators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06280","snapshot_observed_at":"2026-08-06T19:46:42.138257Z","title":"Language models are realistic tabular data generators.arXiv preprint arXiv:2210.06280, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:42.138257Z"},"links":{"cited_paper":"/paper/2210.06280","citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:cb5c3a099b95c54ef893f7607b6a92f55c2ce3d769cfe6fdbe8707400a1a59ea","observation_id":"7f2db700-692b-483a-a5ee-f2ba72ec2510","resolution":{"observed_at":"2026-08-06T19:46:42.138257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T19:46:42.053276Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:42.053276Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:c8b27c391ba215347bff1e06c82a34b310b1cbbd5570201d9a8210336d907a15","observation_id":"5325adc0-2019-45cd-8e1b-12da588388f8","resolution":{"observed_at":"2026-08-06T19:46:42.053276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:42.981802Z","title":"Listed Security","venue":null,"work_id":"b371f835-5eb3-4dd9-9cfc-542e63e6326e","year":2019},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:42.222982Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:2309b958b09ff94b5d5f26a176d6b7fca128e0427b5f0ab04144c3506bbf8814","observation_id":"6e90b19b-322f-4a3b-9227-bdbe48f31031","resolution":{"observed_at":"2026-08-06T19:46:43.083215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08204","last_updated":"2021-05-17T23:54:08Z","snapshot_observed_at":"2026-07-06T11:10:17.453429Z","submitted_at":"2021-05-17T23:54:08Z","title":"Synthesising Multi-Modal Minority Samples for Tabular Data","version":1},"cited_work":{"arxiv_id":"2105.08204","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.08204","snapshot_observed_at":"2026-08-06T19:46:42.386240Z","title":"Synthesising Multi-Modal Minority Samples for Tabular Data","venue":"cs.LG","work_id":"b58ed345-9501-46fa-a671-44fa85762b16","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.270318Z"},"links":{"cited_paper":"/paper/2105.08204","citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:967bf6f13d0ec3d6901a54914794f4e050b408540405933012afbaddb27efd8e","observation_id":"de01cac0-a272-425e-937b-181ac35210a8","resolution":{"observed_at":"2026-08-06T19:46:42.437346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","latest_version":2,"primary_category":"cs.DB","snapshot_observed_at":"2026-08-06T19:39:54.563905Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":3,"verified_fuzzy":36},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2507.04687."}