{"as_of":"2026-08-08T03:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42648b8a708b84d06c2505bafea7c30836bbc8a2bcb70e3c96d94bccd933d302","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T13:06:59.375076Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T20:02:33.346701Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T22:15:50.902427Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"cited_work":{"arxiv_id":"2601.00575","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.00575","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c5071b21-cd46-4bd2-9c2b-196a1a96de3f","year":2026},"citing_paper":{"arxiv_id":"2604.05289","last_updated":"2026-04-07T00:47:37Z","snapshot_observed_at":"2026-08-01T18:59:29.157128Z","submitted_at":"2026-04-07T00:47:37Z","title":"FLARE: Agentic Coverage-Guided Fuzzing for LLM-Based Multi-Agent Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T20:02:33.346701Z"},"links":{"cited_paper":"/paper/2601.00575","citing_paper":"/paper/2604.05289"},"observation_digest":"sha256:5b016b17f728d79b15a63ee2ce861c1887e0779173fb192b32dc00ad050df9fa","observation_id":"b36d83cd-1e5c-4604-8f3d-091e50357979","resolution":{"observed_at":"2026-05-27T02:05:09.831408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.00575/citation-record","integrity":"/paper/2601.00575/integrity","json":"/paper/2601.00575/citation-record.json","paper":"/paper/2601.00575"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-03T13:06:55.851757Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions.ArXiv preprint, abs/2406.15877, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:55.851757Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:4b68452b495bf1abc447e059b87c423a86ffe9fa8a932c483ef2693f373a3783","observation_id":"f3de058c-7aba-4794-8363-d8684974b1da","resolution":{"observed_at":"2026-08-03T13:06:55.851757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-03T13:06:55.931537Z","title":"Nye, Maarten Bosma, Henryk Michalewski, David Dohan, Ellen Jiang, Carrie J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:55.931537Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:45eda24b7499f2cdd2a7b1210df14de59c0c57ae8904c7ac0e84811459ab1b53","observation_id":"bffcf012-bfdc-4ad3-a0db-5799ec02c6ba","resolution":{"observed_at":"2026-08-03T13:06:55.931537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-03T13:06:55.990460Z","title":"Evaluat- ing Large Language Models Trained on Code.ArXiv preprint, abs/2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:55.990460Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:8345a7ed9ade471bc55b2895a55cd61424edd901d73d641354686d9b30792446","observation_id":"6e3cd75c-b47b-44ea-9e37-106507f75ebe","resolution":{"observed_at":"2026-08-03T13:06:55.990460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03837","last_updated":"2024-10-23T22:22:20Z","snapshot_observed_at":"2026-08-02T20:23:47.169508Z","submitted_at":"2024-10-04T18:05:22Z","title":"Learning Code Preference via Synthetic Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03837","snapshot_observed_at":"2026-08-03T13:06:56.241435Z","title":"Learning Code Preference via Synthetic Evolution.ArXiv preprint, abs/2410.03837, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:56.241435Z"},"links":{"cited_paper":"/paper/2410.03837","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:1b76434f409b9de468ec75b873081545ed501461a53780d973fe62206f3b8e39","observation_id":"7c85c229-fcb5-4a33-9dae-16d0bacd200c","resolution":{"observed_at":"2026-08-03T13:06:56.241435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21077","last_updated":"2025-05-22T23:36:42Z","snapshot_observed_at":"2026-07-06T18:54:41.705593Z","submitted_at":"2024-07-29T20:42:59Z","title":"Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21077","snapshot_observed_at":"2026-08-03T13:06:56.330378Z","title":"Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models.ArXiv preprint, abs/2407.21077, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:56.330378Z"},"links":{"cited_paper":"/paper/2407.21077","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:9a6853554742dc4872925930223c45660b00da0c0eb372a6b4440b5033985f55","observation_id":"d4be606b-721e-4d4b-89e0-b12cab9a134a","resolution":{"observed_at":"2026-08-03T13:06:56.330378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01836","last_updated":"2025-03-03T18:56:44Z","snapshot_observed_at":"2026-08-07T17:32:41.410021Z","submitted_at":"2025-03-03T18:56:44Z","title":"CrowdSelect: Synthetic Instruction Data Selection with Multi-LLM Wisdom","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01836","snapshot_observed_at":"2026-08-03T13:06:56.391359Z","title":"CrowdSelect: Synthetic Instruction Data Selection with Multi-LLM Wisdom.ArXiv preprint, abs/2503.01836, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:56.391359Z"},"links":{"cited_paper":"/paper/2503.01836","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:ffa643d47bf3f6f3bc9c07f6de45ff7a463ddc753f92a05db3f8f3d0b9c585c4","observation_id":"d12fa573-64ec-49d5-b639-c804378e878d","resolution":{"observed_at":"2026-08-03T13:06:56.391359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18693","last_updated":"2025-05-27T11:56:56Z","snapshot_observed_at":"2026-07-06T19:39:01.657517Z","submitted_at":"2024-10-24T12:42:04Z","title":"Unleashing LLM Reasoning Capability via Scalable Question Synthesis from Scratch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18693","snapshot_observed_at":"2026-08-03T13:06:56.449752Z","title":"Unleashing Reasoning Capability of LLMs via Scalable Question Synthesis from Scratch.ArXiv preprint, abs/2410.18693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:56.449752Z"},"links":{"cited_paper":"/paper/2410.18693","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:8048412c8610131543170be1569d5099fa644b0787d24f642e536a837333d2e8","observation_id":"05ed4e35-2f7e-45cf-887d-99c26bddc183","resolution":{"observed_at":"2026-08-03T13:06:56.449752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06453","last_updated":"2025-02-12T23:16:27Z","snapshot_observed_at":"2026-08-07T13:42:52.896081Z","submitted_at":"2025-02-10T13:31:46Z","title":"MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06453","snapshot_observed_at":"2026-08-03T13:06:56.522253Z","title":"MATH-Perturb: Benchmarking LLMs’ Math Reasoning Abilities against Hard Perturbations.ArXiv preprint, abs/2502.06453, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:56.522253Z"},"links":{"cited_paper":"/paper/2502.06453","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:af470b94a08ffbe3ab5a5a4904981fada9dd0ace5ef7f9a29b9dd9ae1c6b2970","observation_id":"bf591bfb-47c0-48cf-9a55-9b0d8c4e6d32","resolution":{"observed_at":"2026-08-03T13:06:56.522253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06233","last_updated":"2025-04-28T00:00:43Z","snapshot_observed_at":"2026-08-01T15:47:10.909338Z","submitted_at":"2023-11-10T18:48:58Z","title":"Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06233","snapshot_observed_at":"2026-08-03T13:06:56.632597Z","title":"Data Contamination Quiz: A Tool to Detect and Esti- mate Contamination in Large Language Models.ArXiv preprint, abs/2311.06233, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:56.632597Z"},"links":{"cited_paper":"/paper/2311.06233","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:adc0004870d55df2820b1b6493d99d2abc211198155303d05d86a5301e66ee6b","observation_id":"9ae1a502-7f26-4476-a943-dbeec43be201","resolution":{"observed_at":"2026-08-03T13:06:56.632597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:56.715562Z","title":"Investigating data contamination in modern benchmarks for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:56.715562Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:eb28b976e6dbc82ce30c94dc390d5bb87cba7cb38cb2dff3f53d3dad281b3ae0","observation_id":"3029555b-e8df-42a5-819c-a8b989a4c571","resolution":{"observed_at":"2026-08-03T13:06:56.715562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:56.785264Z","title":"A careful examination of large language model performance on grade school arithmetic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:56.785264Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:c2bc518b1df466a9539cf1bbe4e424ad8fb8dc794ba9aca2554bfd80a8509cc2","observation_id":"c7af6975-7705-48c2-9735-dff15f3655f1","resolution":{"observed_at":"2026-08-03T13:06:56.785264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:56.887852Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:56.887852Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:6630cc40256522cf1fc9441a6de2461180806d21914ebadce1c461849cd7ae96","observation_id":"c8b5ff6b-e1f5-4504-95b4-b062c23ff360","resolution":{"observed_at":"2026-08-03T13:06:56.887852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:56.971044Z","title":"PromptCoT: Synthesizing Olympiad- level Problems for Mathematical Reasoning in Large Language Models.ArXiv preprint, abs/2503.02324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:56.971044Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:edd4234c23205eb668c1bc6480f691dfd36de461a951abf7049aacfa4a3c8307","observation_id":"c7ec2056-2643-4991-b361-8d3da8feb0b3","resolution":{"observed_at":"2026-08-03T13:06:56.971044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:57.081439Z","title":"Wizardlm: Empowering large pre-trained language models to follow complex instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.081439Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:2f9a9f647994421d7392e5acd15af40925ef0774b35a8eb85939183ff701a8c3","observation_id":"8c29a0e5-864a-4fcd-90c9-5ea59198309c","resolution":{"observed_at":"2026-08-03T13:06:57.081439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02951","last_updated":"2025-07-12T02:08:21Z","snapshot_observed_at":"2026-08-07T17:29:28.382943Z","submitted_at":"2025-03-04T19:17:36Z","title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02951","snapshot_observed_at":"2026-08-03T13:06:57.148919Z","title":"Kod- Code: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding.ArXiv preprint, abs/2503.02951, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.148919Z"},"links":{"cited_paper":"/paper/2503.02951","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:77d60573497029f7ac8055f0ec8b7e992ddf0d0477f03d7845304b8e77157361","observation_id":"8bbdfa41-e06b-4a2d-bfaf-9a5b9630502a","resolution":{"observed_at":"2026-08-03T13:06:57.148919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13611","last_updated":"2024-12-10T07:47:15Z","snapshot_observed_at":"2026-07-30T19:58:07.787316Z","submitted_at":"2024-11-20T02:03:16Z","title":"DSTC: Direct Preference Learning with Only Self-Generated Tests and Code to Improve Code LMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13611","snapshot_observed_at":"2026-08-03T13:06:57.228768Z","title":"DSTC: Direct Preference Learning with Only Self-generated Tests and Code to Improve Code LMs.ArXiv preprint, abs/2411.13611, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.228768Z"},"links":{"cited_paper":"/paper/2411.13611","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:91746e04a000e07d3e23dc806f0ec1b6060d9637092761d7db1231cc7faf759f","observation_id":"92d7c7ee-9db1-488a-b51e-8352c5292a96","resolution":{"observed_at":"2026-08-03T13:06:57.228768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04349","last_updated":"2023-11-13T03:49:27Z","snapshot_observed_at":"2026-07-06T15:51:58.017259Z","submitted_at":"2023-07-10T05:18:18Z","title":"RLTF: Reinforcement Learning from Unit Test Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04349","snapshot_observed_at":"2026-08-03T13:06:57.310399Z","title":"RLTF: Reinforcement Learning from Unit Test Feedback.ArXiv preprint, abs/2307.04349, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.310399Z"},"links":{"cited_paper":"/paper/2307.04349","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:5d7a0221d41978c9e41695916ca6c774b9764c923167837f4994120a547b69d0","observation_id":"b94c0dae-105f-471e-bd15-ed0e24365f63","resolution":{"observed_at":"2026-08-03T13:06:57.310399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:57.411327Z","title":"Codet: Code generation with generated tests","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.411327Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:70f96107968265f3a108b81ed80b421b49b79141b621ef66637143abb604af29","observation_id":"43bd36ff-4467-4018-81aa-7d322da81368","resolution":{"observed_at":"2026-08-03T13:06:57.411327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01718","last_updated":"2025-05-24T04:36:48Z","snapshot_observed_at":"2026-07-06T20:30:31.588538Z","submitted_at":"2025-02-03T18:46:04Z","title":"ACECODER: Acing Coder RL via Automated Test-Case Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01718","snapshot_observed_at":"2026-08-03T13:06:57.644309Z","title":"ACECODER: Acing Coder RL via Automated Test-case Synthesis.ArXiv preprint, abs/2502.01718, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.644309Z"},"links":{"cited_paper":"/paper/2502.01718","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:2e69c27c88a6331cf3386a4551cfc90d76d6f0941a85211dc4ad1363094e0d71","observation_id":"a0fb976f-3e71-4e52-b8a6-b6a78b2ac132","resolution":{"observed_at":"2026-08-03T13:06:57.644309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:57.777782Z","title":"AutoBencher: Towards Declarative Benchmark Construction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.777782Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:60aaa314bbdab15831508b39f203c484afee02aabbe01eaab1d9b48837d704cc","observation_id":"c05cfc81-840e-41f6-86c8-b2843ddabd5c","resolution":{"observed_at":"2026-08-03T13:06:57.777782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13335","last_updated":"2025-03-17T16:15:02Z","snapshot_observed_at":"2026-08-07T16:57:21.932530Z","submitted_at":"2025-03-17T16:15:02Z","title":"Reliable and Efficient Amortized Model-based Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13335","snapshot_observed_at":"2026-08-03T13:06:57.856178Z","title":"Truong, Yuheng Tu, Percy Liang, Bo Li, and Sanmi Koyejo","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.856178Z"},"links":{"cited_paper":"/paper/2503.13335","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:0221b392c2ee76f1d802d8b75c22208a7051911456acf97a501bb450d8e9d736","observation_id":"123ed1fc-0488-4c1a-8f4c-b83a1ad1cf3b","resolution":{"observed_at":"2026-08-03T13:06:57.856178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:57.906527Z","title":"Agentsynth: Scalable task generation for generalist computer-use agents.arXiv preprint arXiv:2506.14205, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.906527Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:5b55deee3bb949d287fe14bcb8ebd38772094ef91ee66fdf629053964b2986f6","observation_id":"fdeccba1-bbef-4460-98ff-3f94968f426b","resolution":{"observed_at":"2026-08-03T13:06:57.906527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:57.954155Z","title":"TaskE- val: Assessing Difficulty of Code Generation Tasks for Large Language Models.ArXiv preprint, abs/2407.21227, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.954155Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:a71e38b13a063cf563305ce58801d203c02c32f5bb9ad5064a82c0a4fcdda834","observation_id":"abf59272-dfc7-4663-a980-298e06bce364","resolution":{"observed_at":"2026-08-03T13:06:57.954155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T13:06:57.994680Z","title":"Proximal Policy Optimization Algorithms.ArXiv preprint, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.994680Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:7b3ed54597cc573a84bc76916ed658bf8d8ee10fabd87af19e78b5a68986a894","observation_id":"024a8bd0-43ef-4564-a37a-40ef30ca35f8","resolution":{"observed_at":"2026-08-03T13:06:57.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-03T13:06:58.157615Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:58.157615Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:7fcbabd98b65fbb068808fa87e3d9c719f2ad04682fc9bc130eb14fac2e0ad2e","observation_id":"1383ffe7-6984-470b-9f3b-f3be67f45976","resolution":{"observed_at":"2026-08-03T13:06:58.157615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:58.234612Z","title":"Kulkarni, and Sergio Verd ´u","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:58.234612Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:d143ad8dc75e1ac1dc9154f99bd3147ea5d6dcb65f025d96c6054d28984d29b1","observation_id":"d171bd11-90d0-4cc3-ae25-5628caeaa069","resolution":{"observed_at":"2026-08-03T13:06:58.234612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:58.342371Z","title":"Mpnet: Masked and permuted pre-training for language understanding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:58.342371Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:059cf345c329db0342e94da222f685724b19ea3161d704b09cee7e5f5d46c924","observation_id":"9b5f036f-6a77-43e8-b0b7-f0f04d8a24fe","resolution":{"observed_at":"2026-08-03T13:06:58.342371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:58.516361Z","title":"UMAP: Uniform Manifold Approximation and Projection.J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:58.516361Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:7a6bec5f6642bcad36584b862e09cbdacc8df1a3bbaacf0d4b906a382955c0b7","observation_id":"21e0e937-5a03-49d2-b033-bf43f092c417","resolution":{"observed_at":"2026-08-03T13:06:58.516361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:58.616219Z","title":"leetcode-problem-set.https://huggingface.co/datasets/kaysss/ leetcode-problem-set, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:58.616219Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:f8f90bfd7c3418aa86da55f7123c84a6f5497fc2e59c633b059c438b6d085bdd","observation_id":"a3cd2884-39e6-4a8c-83a7-56a79fb737b1","resolution":{"observed_at":"2026-08-03T13:06:58.616219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-03T13:06:58.708260Z","title":"Measuring coding challenge competence with apps.ArXiv preprint, abs/2105.09938, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:58.708260Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:e23c1f9c0a6c8c363a73d6b4e34acc50e780dac5d7c1e39d0532c78ac86fde9f","observation_id":"724e547d-0f80-4af4-90ff-51fda4f5713b","resolution":{"observed_at":"2026-08-03T13:06:58.708260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:58.778454Z","title":"Codeforces Problems Dataset.https://huggingface.co/datasets/open-r1/ codeforces, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:58.778454Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:c9edaec1fb6433711a9c29d039934313896f83daf9291fb55563414ecb9ee5a4","observation_id":"84ceb433-499b-4bdc-b138-dab9f9506927","resolution":{"observed_at":"2026-08-03T13:06:58.778454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:58.878286Z","title":"Estimating mutual information","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:58.878286Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:dc4acc0ff23e46ad5f139e5f7bb98cc36f33d34a540838bc2549299b8ad9ddd8","observation_id":"9a6f66b5-297e-45b4-bbfc-d13b631313ec","resolution":{"observed_at":"2026-08-03T13:06:58.878286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:58.965242Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:58.965242Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:950da2d94ce26a67890f900083738b8ae8dc6292aac28ed3fd0b8ca8c758b0c8","observation_id":"2d5fba77-c506-498a-9dea-3eee727b60df","resolution":{"observed_at":"2026-08-03T13:06:58.965242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T13:06:59.062298Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:59.062298Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:3a95e1be20b928ffe6570d719289ad6505d182b692db6ee71d283fcc65a19d21","observation_id":"9c4ed60e-8a87-4571-bc77-66482d40e6f7","resolution":{"observed_at":"2026-08-03T13:06:59.062298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14655","last_updated":"2025-04-20T15:28:16Z","snapshot_observed_at":"2026-08-07T16:00:46.114758Z","submitted_at":"2025-04-20T15:28:16Z","title":"LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14655","snapshot_observed_at":"2026-08-03T13:06:59.145164Z","title":"LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs.ArXiv preprint, abs/2504.14655, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:59.145164Z"},"links":{"cited_paper":"/paper/2504.14655","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:cca5ed198540a12502e5527cefbf7a099924e91772e3de1491b035d05b3e8765","observation_id":"9b42878a-468e-41b8-96ca-7a3cfc5e8e58","resolution":{"observed_at":"2026-08-03T13:06:59.145164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.inlg-main.45","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"mutation","venue":null,"work_id":"16c6ccf9-0e64-42dc-a16d-f6415d8848a6","year":2024},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:59.245595Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:be195a745b8c2db7987a9c53215b5eaeff05140ad9d76e3134850b1da92e81ee","observation_id":"35a58ca6-e98b-46ad-a93c-38a70007ad1b","resolution":{"observed_at":"2026-08-03T13:08:44.174150Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:59.303512Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:59.303512Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:17f689921a05d7dc434090346bc524e33306a99445453b09157707ade78b80ac","observation_id":"55ab3509-0acc-47ee-b460-0bac56f41aae","resolution":{"observed_at":"2026-08-03T13:06:59.303512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:59.375076Z","title":"\"\" Returns the second shortest string containing all vowels, sorted alphabetically","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:59.375076Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:6105421c28e81b0d263bfe3d60fb194ee261ca02a5f1c412b44158fef062000b","observation_id":"df3c06f3-6d0b-4b2f-86dc-e979b37ad0e4","resolution":{"observed_at":"2026-08-03T13:06:59.375076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:58.302413Z","title":"URLhttps://doi.org/10.1109/TIT.2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:58.302413Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:db46437665098788c53f64d328f26e5a1bfcae46caceff80e38f2a8a3a39bc75","observation_id":"6e740ced-43f7-4aec-b577-2d1bbd375d31","resolution":{"observed_at":"2026-08-03T13:06:58.302413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-03T13:06:56.139632Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:56.139632Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:207e893a273486317b76001e115a81de0844ead4c39b191e3fd069010be5e72d","observation_id":"b4efbeb3-5fb2-41a3-8528-9c6219c171b7","resolution":{"observed_at":"2026-08-03T13:06:56.139632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:57.459481Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.459481Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:b155d855884cb35794b4a87364c0465b6f7fa7789eef14b57f32424c563ef782","observation_id":"96ffab30-1cc8-4b8e-b853-43c6cee55eaf","resolution":{"observed_at":"2026-08-03T13:06:57.459481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-03T13:06:55.835516Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:55.835516Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:bf5f5d840040211987492dc78b0bf8022c1ee155c0d097b3c4603de27120566e","observation_id":"cc549862-298c-4629-99d0-afa80309e6df","resolution":{"observed_at":"2026-08-03T13:06:55.835516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:06:57.819399Z","title":"URLhttps://openreview.net/forum?id=ymt4crbbXh","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T13:06:57.819399Z"},"links":{"citing_paper":"/paper/2601.00575"},"observation_digest":"sha256:3c7cc77de2eb1879786a785cf1867a6f1ede1ad35db2d912d3791f1503b6ee08","observation_id":"f9a1a96b-adc0-49d9-bd59-15713e5e601e","resolution":{"observed_at":"2026-08-03T13:06:57.819399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.00575","last_updated":"2026-05-26T07:56:19Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T13:06:54.133045Z","submitted_at":"2026-01-02T05:26:27Z","title":"InfoSynth: Information-Guided Benchmark Synthesis for LLMs"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2601.00575."}