{"as_of":"2026-08-08T11:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3e9baaebc4307dd11ade07f20bf3afb4951f0234826420f375ecf9e96139385","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:52:50.638681Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.22768/citation-record","integrity":"/paper/2509.22768/integrity","json":"/paper/2509.22768/citation-record.json","paper":"/paper/2509.22768"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:45.456078Z","title":"MEGA : Multilingual evaluation of generative AI","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:45.456078Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:e9af1d4781c4ec418fb4568a39771ddf2c4992a7be7f547e9752dcd88d459f82","observation_id":"e420ec97-8354-432d-a81f-1547a576a8ea","resolution":{"observed_at":"2026-08-04T14:52:45.456078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:45.542088Z","title":"Don’t push the button! exploring data leakage risks in machine learning and transfer learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:45.542088Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:6c56050607b3eaadefe153889a17af097ba04597337407a8c5ce16afd5309c10","observation_id":"c4338902-d974-4a93-876b-1961c01736a7","resolution":{"observed_at":"2026-08-04T14:52:45.542088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:45.681840Z","title":"Do, Yan Xu, and Pascale Fung","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:45.681840Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:6e65ee5567af886872c26977e8e1b43b78814f1f6a3e2c56b043b75e6ff7f19a","observation_id":"fda118ab-8731-4786-9027-99de33468a22","resolution":{"observed_at":"2026-08-04T14:52:45.681840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:45.852056Z","title":"MLE -bench: Evaluating machine learning agents on machine learning engineering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:45.852056Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:a3f5431e5951aa89a87463b850e10fc44871fab3ac15fc494cdcfefd92839658","observation_id":"dca7e741-24e2-4292-9f0e-f13a89578fa3","resolution":{"observed_at":"2026-08-04T14:52:45.852056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T04:13:14.044604Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-04T14:52:45.983121Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:45.983121Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:669f69b8412d7c9be827ae196fbf5ab62d203df993a6461ed27d98beebc65e14","observation_id":"10b37b62-bc47-488b-9a0e-fce59ebf2109","resolution":{"observed_at":"2026-08-04T14:52:45.983121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:46.093206Z","title":"R o C ode: A dataset for measuring code intelligence from problem definitions in R omanian","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.093206Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:4cda53958cad327c97f4f2c0f9e0799a7cb139de3a0f14e4250d658c7f2f8438","observation_id":"a45a150c-1add-4c85-82db-133695def190","resolution":{"observed_at":"2026-08-04T14:52:46.093206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16073","last_updated":"2024-08-06T12:32:15Z","snapshot_observed_at":"2026-08-05T16:41:33.195500Z","submitted_at":"2022-11-29T10:30:40Z","title":"Abstract Interpretation-Based Data Leakage Static Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.16073","snapshot_observed_at":"2026-08-04T14:52:46.250742Z","title":"Abstract interpretation-based data leakage static analysis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.250742Z"},"links":{"cited_paper":"/paper/2211.16073","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:669362fecebd4986e48c4ac137ecc66a664f294fb6746ca704b16979a6790556","observation_id":"425917cb-f6cb-41aa-8a6e-6738841ed173","resolution":{"observed_at":"2026-08-04T14:52:46.250742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:46.373728Z","title":"Code4ml: a large-scale dataset of annotated machine learning code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.373728Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:e518d97b3dfffe8623a690ea657b4d650ab5278363db5a6c3e7499d5f0f1e9eb","observation_id":"39787f77-bd8c-43c9-9bcf-20c0f0673a44","resolution":{"observed_at":"2026-08-04T14:52:46.373728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:46.445465Z","title":"Neural architecture search: A survey","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.445465Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:2cdc50f971af37ddaf4b55ad31ad62f7aea8448a81b7c0bec5403ed084afbf95","observation_id":"f4603158-7b91-40af-9387-07492a75bb3d","resolution":{"observed_at":"2026-08-04T14:52:46.445465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:46.648892Z","title":"Efficient and robust automated machine learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.648892Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:5411a74c63f41d11d0db9027e8ec78a0833d1ed498ff0698bbcf4b26fd7440a6","observation_id":"06e7f6d6-bf49-4634-9cae-cf4c12d5ebb3","resolution":{"observed_at":"2026-08-04T14:52:46.648892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09210","last_updated":"2023-02-18T02:11:36Z","snapshot_observed_at":"2026-08-08T03:31:17.640404Z","submitted_at":"2023-02-18T02:11:36Z","title":"How Good Are GPT Models at Machine Translation? A Comprehensive Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09210","snapshot_observed_at":"2026-08-04T14:52:46.813328Z","title":"How good are gpt models at machine translation? a comprehensive evaluation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.813328Z"},"links":{"cited_paper":"/paper/2302.09210","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:5af11bed977ee10e8c6c70ac9eb05600407a88f49c93e46525152b32a72afda3","observation_id":"cdd74d53-5673-4387-b47e-707c26cb6546","resolution":{"observed_at":"2026-08-04T14:52:46.813328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:46.924451Z","title":"DA -code: Agent data science code generation benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.924451Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:cfc2e0b2e8ad5559a7b2248955014411bb56f9afed0543a6202aa992a5f5721f","observation_id":"64d76b61-f079-48b1-a95a-190502e4a1bc","resolution":{"observed_at":"2026-08-04T14:52:46.924451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09436","last_updated":"2020-06-08T09:09:28Z","snapshot_observed_at":"2026-08-06T10:54:14.530969Z","submitted_at":"2019-09-20T11:52:45Z","title":"CodeSearchNet Challenge: Evaluating the State of Semantic Code Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.09436","snapshot_observed_at":"2026-08-04T14:52:47.012365Z","title":"Codesearchnet challenge: Evaluating the state of semantic code search","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.012365Z"},"links":{"cited_paper":"/paper/1909.09436","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:0c8b8817870427f0f754edc92a2e04efabd08ecac82a147dbc8b2312698a3663","observation_id":"a5f330a1-39c7-4150-82bd-85682835644d","resolution":{"observed_at":"2026-08-04T14:52:47.012365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13138","last_updated":"2025-02-18T18:57:21Z","snapshot_observed_at":"2026-08-05T07:03:00.655237Z","submitted_at":"2025-02-18T18:57:21Z","title":"AIDE: AI-Driven Exploration in the Space of Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13138","snapshot_observed_at":"2026-08-04T14:52:47.132960Z","title":"Aide: Ai-driven exploration in the space of code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.132960Z"},"links":{"cited_paper":"/paper/2502.13138","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:88cd8d15fce2a3ade514cf02f24aa028dfaca2e23e877e71e7f8b9802e9c8923","observation_id":"d35eff5a-5cfa-4009-bc98-c4dad0339ada","resolution":{"observed_at":"2026-08-04T14:52:47.132960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08745","last_updated":"2023-11-02T07:19:37Z","snapshot_observed_at":"2026-07-06T14:43:16.371886Z","submitted_at":"2023-01-20T08:51:36Z","title":"Is ChatGPT A Good Translator? Yes With GPT-4 As The Engine","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08745","snapshot_observed_at":"2026-08-04T14:52:47.365507Z","title":"Is chatgpt a good translator? yes with gpt-4 as the engine, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.365507Z"},"links":{"cited_paper":"/paper/2301.08745","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:46a3f9e1785f311208a7e98ecb28109b3c5667d67cfbb352fcbbe68ee5046f3b","observation_id":"67fa34a3-6f01-4847-9cac-5ac1b1c4e261","resolution":{"observed_at":"2026-08-04T14:52:47.365507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:47.579659Z","title":"Better to ask in english: Cross-lingual evaluation of large language models for healthcare queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.579659Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:4c5d23e1a4339e9bb2deb5d2967e8d4b041953a6bb6022d01b666aaf6bf29515","observation_id":"52378ff4-98e4-4e66-95d1-24e301beb581","resolution":{"observed_at":"2026-08-04T14:52:47.579659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:47.761260Z","title":"Leakage and the reproducibility crisis in machine-learning-based science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.761260Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:bbbf1cbdef3bc0843ab77862eed92c6b8052dca844a62ae3470ec29a67188c5d","observation_id":"ad604c15-4f00-481d-a0ba-c1830dfb1ad1","resolution":{"observed_at":"2026-08-04T14:52:47.761260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:47.897537Z","title":"Ds-1000: a natural and reliable benchmark for data science code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.897537Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:952c6368578c8fa12402dd973a51c85356a28b43d36b342d38b84bf8d12a3072","observation_id":"91e5a2f4-be41-4d93-9f6c-8bad564ac27e","resolution":{"observed_at":"2026-08-04T14:52:47.897537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:47.995256Z","title":"H2o automl: Scalable automatic machine learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.995256Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:79e4e1c3c7730eec390fd80f90744b848b8c197a55d23fa6db337b44ae6649c3","observation_id":"a4eb0139-5aa9-4a31-b3ab-889cb471791b","resolution":{"observed_at":"2026-08-04T14:52:47.995256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09701","last_updated":"2025-05-09T18:19:23Z","snapshot_observed_at":"2026-08-04T23:12:29.820583Z","submitted_at":"2024-08-19T05:11:46Z","title":"Bridging the Language Gap: Enhancing Multilingual Prompt-Based Code Generation in LLMs via Zero-Shot Cross-Lingual Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09701","snapshot_observed_at":"2026-08-04T14:52:48.068875Z","title":"Bridging the language gap: Enhancing multilingual prompt-based code generation in llms via zero-shot cross-lingual transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.068875Z"},"links":{"cited_paper":"/paper/2408.09701","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:19019ee8edf13fae8034b246180ec1f7e3ed3779dd80da8db1e37de6eee2a9d6","observation_id":"a4d37812-aefe-45e9-98a7-5c376415acb8","resolution":{"observed_at":"2026-08-04T14:52:48.068875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-04T14:52:48.179470Z","title":"Starcoder: may the source be with you! arXiv preprint arXiv:2305.06161, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.179470Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:9457aea1ca72130d727dc05f782f63466614b4051c844edfcca104d633dbd0d0","observation_id":"d4a1793e-a95c-4941-a3a7-2bb8a7f54953","resolution":{"observed_at":"2026-08-04T14:52:48.179470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:48.326957Z","title":"DARTS : Differentiable architecture search","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.326957Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:b7ca9622663ddf643a997eb9bb48cd689d33eee061ac9de800333d5ed01cdb68","observation_id":"6bfeca5d-667a-4960-8f82-747f5eb2a5a2","resolution":{"observed_at":"2026-08-04T14:52:48.326957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07565","last_updated":"2024-10-03T16:48:55Z","snapshot_observed_at":"2026-08-04T18:31:06.905572Z","submitted_at":"2024-07-10T11:50:20Z","title":"On Leakage of Code Generation Evaluation Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07565","snapshot_observed_at":"2026-08-04T14:52:48.436986Z","title":"On leakage of code generation evaluation datasets, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.436986Z"},"links":{"cited_paper":"/paper/2407.07565","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:a47d5d72af91cbaa126309cf54c3170fef1506d68375e077c1f4789163459a7e","observation_id":"aee95852-047f-4726-848b-90c4e94a2711","resolution":{"observed_at":"2026-08-04T14:52:48.436986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:48.607551Z","title":"Evaluating programming language confusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.607551Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:8d931b78358fd4186012b6e6531057d5c3f8819b7ceff418e5c2b4896864c523","observation_id":"bc99bfad-adb8-401d-99c3-edd33fc5aef6","resolution":{"observed_at":"2026-08-04T14:52:48.607551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:48.698716Z","title":"Crosslingual generalization through multitask finetuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.698716Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:8ffaa025926529f766939e35b0c1642ebf6b4c1df574ebd86ed6b558e0b1d78c","observation_id":"9f7c6e13-9f1b-40f0-bdf6-d2d5f498f3a1","resolution":{"observed_at":"2026-08-04T14:52:48.698716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:48.870432Z","title":"Olson, Nathan Bartley, Ryan J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.870432Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:22318a2b1142d9af7bd89bdf3edad40557b35ab5f66ae8ebdf5880fcab730795","observation_id":"f0c9f926-3437-4da0-a311-d138b1341510","resolution":{"observed_at":"2026-08-04T14:52:48.870432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:49.054155Z","title":"Dscodebench: A realistic benchmark for data science code generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.054155Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:8e51b5fe24a52b3ad99f444a65d907a1be860df271641d4fd188ee91e902d0b8","observation_id":"243d93b9-8f3d-4874-9e8c-97848239dccd","resolution":{"observed_at":"2026-08-04T14:52:49.054155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:49.202574Z","title":"Efficient neural architecture search via parameters sharing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.202574Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:c86f813c3b4c922cb909506fe3af2ef95b0f3f16567300e8a735ded3f3502d8c","observation_id":"59e74f38-68e8-484c-b5ff-0a7d8079fcc3","resolution":{"observed_at":"2026-08-04T14:52:49.202574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:49.284097Z","title":"Meta kaggle code, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.284097Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:b53a9560105e1a897351308579f73808ca5716630982a2c26d5ece64737b7e49","observation_id":"936bb467-1a9a-4eeb-851c-286e5ddfbb1a","resolution":{"observed_at":"2026-08-04T14:52:49.284097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:49.398954Z","title":"m H uman E val - a multilingual benchmark to evaluate large language models for code generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.398954Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:d8406fb35b06f15eb5f08d1141ae703c0aa424f6ec8a19be6aa43854ccf67cbf","observation_id":"4a33406c-9442-49cb-8bf8-8d48daa9312e","resolution":{"observed_at":"2026-08-04T14:52:49.398954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16806","last_updated":"2023-06-06T03:15:43Z","snapshot_observed_at":"2026-08-04T07:19:58.667078Z","submitted_at":"2023-05-26T10:38:31Z","title":"Do GPTs Produce Less Literal Translations?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16806","snapshot_observed_at":"2026-08-04T14:52:49.483019Z","title":"Do gpts produce less literal translations?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.483019Z"},"links":{"cited_paper":"/paper/2305.16806","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:5601b4cd086816ae6f278499343312586b1396aaf1ad93a379d033047343d2f2","observation_id":"3f05b8c5-4f13-46ec-b7c1-fe72e521d0d3","resolution":{"observed_at":"2026-08-04T14:52:49.483019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-04T14:52:49.569202Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.569202Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:b38e457d8d916d8b119e2e7b0106b68b123d98dfb43bece64d9d65ecb7d65d7b","observation_id":"65082097-3b06-4b20-8026-2dbca25f9768","resolution":{"observed_at":"2026-08-04T14:52:49.569202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:49.671243Z","title":"Sasse, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.671243Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:614a102561b4fdf79b57560f2ff572ab26335604e74ee0ab2b47de7f762598e3","observation_id":"c6db1d1c-91fa-49b1-8832-53d5913799c8","resolution":{"observed_at":"2026-08-04T14:52:49.671243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:49.760663Z","title":"Biocoder: a benchmark for bioinformatics code generation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.760663Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:aa2598a27505d4da42f71bfe69f1a5ae25326050b007633a70c0ab45e7ed593c","observation_id":"d57d06e2-b08b-40d7-a4fd-2a0050e7339b","resolution":{"observed_at":"2026-08-04T14:52:49.760663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13168","last_updated":"2024-07-18T05:15:24Z","snapshot_observed_at":"2026-07-06T18:48:12.383629Z","submitted_at":"2024-07-18T05:15:24Z","title":"SciCode: A Research Coding Benchmark Curated by Scientists","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13168","snapshot_observed_at":"2026-08-04T14:52:49.846361Z","title":"Scicode: A research coding benchmark curated by scientists","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.846361Z"},"links":{"cited_paper":"/paper/2407.13168","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:99ac6870f400f78d991abbaf988181a80eba41f3480d3a4c6ece13599e9c5741","observation_id":"c6c3e951-9187-446f-8974-1a3d1d2f5592","resolution":{"observed_at":"2026-08-04T14:52:49.846361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01528","last_updated":"2022-04-05T13:45:00Z","snapshot_observed_at":"2026-07-06T11:44:05.282403Z","submitted_at":"2021-09-03T13:52:32Z","title":"LightAutoML: AutoML Solution for a Large Financial Services Ecosystem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01528","snapshot_observed_at":"2026-08-04T14:52:49.910664Z","title":"Lightautoml: Automl solution for a large financial services ecosystem, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.910664Z"},"links":{"cited_paper":"/paper/2109.01528","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:c3974ecf6a2bf29c2e852702c6393013df58028c7b242afdd74daa55d1385146","observation_id":"da2f3360-d57d-4ea2-b2bf-ee6767351e45","resolution":{"observed_at":"2026-08-04T14:52:49.910664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-02T14:58:44.167588Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-04T14:52:49.994121Z","title":"Xu, Xiangru Tang, Mingchen Zhuge, Jiayi Pan, Yueqi Song, Bowen Li, Jaskirat Singh, Hoang H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.994121Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:4e0efb6bb16c75d610963dbb947318ff6fde1c37afbb32060dda75f0c9109094","observation_id":"326cfc55-677f-4256-a3a3-b34b38dc4559","resolution":{"observed_at":"2026-08-04T14:52:49.994121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08388","last_updated":"2023-02-07T03:12:50Z","snapshot_observed_at":"2026-08-01T15:13:33.142086Z","submitted_at":"2022-03-16T04:21:50Z","title":"MCoNaLa: A Benchmark for Code Generation from Multiple Natural Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08388","snapshot_observed_at":"2026-08-04T14:52:50.080171Z","title":"Mconala: A benchmark for code generation from multiple natural languages","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.080171Z"},"links":{"cited_paper":"/paper/2203.08388","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:fb76ad6ce966a7b5cba097d1e43a190c6d1995fa836c017e8f8164834048a10a","observation_id":"0373be4a-3c79-484c-9b03-7ede74aba817","resolution":{"observed_at":"2026-08-04T14:52:50.080171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03345","last_updated":"2022-09-07T17:59:42Z","snapshot_observed_at":"2026-08-05T14:54:46.959481Z","submitted_at":"2022-09-07T17:59:42Z","title":"Data Leakage in Notebooks: Static Detection and Better Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03345","snapshot_observed_at":"2026-08-04T14:52:50.160601Z","title":"Lewis, and Christian Kästner","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.160601Z"},"links":{"cited_paper":"/paper/2209.03345","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:bac943d9a11145f984ec4c9c3fbd68bd62197ce7d2e6c10f0be86f7685c3664a","observation_id":"3606950e-8203-4733-bc79-7f5e90003c6f","resolution":{"observed_at":"2026-08-04T14:52:50.160601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06215","last_updated":"2025-02-10T07:33:49Z","snapshot_observed_at":"2026-07-06T20:33:48.242475Z","submitted_at":"2025-02-10T07:33:49Z","title":"LessLeak-Bench: A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06215","snapshot_observed_at":"2026-08-04T14:52:50.211290Z","title":"Lessleak-bench: A first investigation of data leakage in llms across 83 software engineering benchmarks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.211290Z"},"links":{"cited_paper":"/paper/2502.06215","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:da5583a7ad57173cb7eceabdd982b8b5a496080b6594451030f421656108188d","observation_id":"454558da-8267-4e9d-ada2-7797949bcc52","resolution":{"observed_at":"2026-08-04T14:52:50.211290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.1.11854","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Journal of Artificial Intelligence Research","work_id":"e3f90a6c-1234-4175-b0e1-4859a69d3e8c","year":2021},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.314164Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:1b03e006055518ff6277fc362e080f15752b1a4a5d71162ad4ac56f6b6f386b4","observation_id":"47f62696-d9f4-4954-9b87-f220d173af03","resolution":{"observed_at":"2026-08-04T14:53:21.126268Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:50.383648Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.383648Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:8e3f31a7daba15bbe98ca1e813048841f0b572fd9a8f0756489dec185c38b026","observation_id":"f4f7e8e6-5ff7-4d32-ba10-0a1256f3afdd","resolution":{"observed_at":"2026-08-04T14:52:50.383648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:50.475733Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.475733Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:d637b8891641f302ee43a8fc799e3f34d8b95c38252dcecad8513694600a2bd7","observation_id":"fcd9988c-2c0a-4aba-9cbc-28b12ce13d36","resolution":{"observed_at":"2026-08-04T14:52:50.475733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:50.558496Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.558496Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:df25b20442f561e11bf397dcab8236e8f2067217d7207b1446ddfa08ca13ed4e","observation_id":"3977f7a0-e450-451e-aab6-3c1c6756bf8f","resolution":{"observed_at":"2026-08-04T14:52:50.558496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:50.638681Z","title":"9rD= <8rrr, 5jTXyyy5V ꬦM`0HΞ=[X5Z ꬀[t ߿XܹSԮ];i qsv Ÿu9 >|Xo =z(00PΝ n: UVzǝ]2Z 4 ڸqV 6c4j(] rR g ǎiJHH=--M + P u5k, iӦ . egg+::Z /VLL ] 3Fwy P uӧ-` (WWW+","venue":null,"work_id":null,"year":1920},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.638681Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:77f297d0c66a41cc8acff3b5d7574f65a298c828df7d852254ec673738b1e4a9","observation_id":"1570824f-2e9a-4fab-9e0c-7eb165238048","resolution":{"observed_at":"2026-08-04T14:52:50.638681Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T08:13:28.206502Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2509.22768."}