{"as_of":"2026-07-22T05:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:900b124832102920bc5077b68c82c2aee820db42a3af94fdb1c519bd74a23c07","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:28:07.557119Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-21T06:31:05.380196+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T10:46:01.272433Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T10:07:56.250102Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"cited_work":{"arxiv_id":"2605.08366","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.08366","snapshot_observed_at":"2026-07-03T10:07:56.250102Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","venue":"cs.LG","work_id":"8023241f-96d7-4ae4-8c1d-20c109c0dc7f","year":2026},"citing_paper":{"arxiv_id":"2606.12507","last_updated":"2026-06-10T17:53:19Z","snapshot_observed_at":"2026-07-06T23:51:27.152983Z","submitted_at":"2026-06-10T17:53:19Z","title":"Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T10:13:55.829195Z"},"links":{"cited_paper":"/paper/2605.08366","citing_paper":"/paper/2606.12507"},"observation_digest":"sha256:9e02fc461d3712d235597304057c0fab029c496a2896c74524a6e804e347ae65","observation_id":"2b35cf8f-dee0-48e7-917d-a9d5eee45189","resolution":{"observed_at":"2026-07-03T10:07:56.251395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"cited_work":{"arxiv_id":"2605.08366","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.08366","snapshot_observed_at":"2026-07-03T10:07:56.250102Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","venue":"cs.LG","work_id":"8023241f-96d7-4ae4-8c1d-20c109c0dc7f","year":2026},"citing_paper":{"arxiv_id":"2606.30573","last_updated":"2026-06-29T17:17:45Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:17:45Z","title":"SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:55:00.679912Z"},"links":{"cited_paper":"/paper/2605.08366","citing_paper":"/paper/2606.30573"},"observation_digest":"sha256:c8a2f5ef3b54dbe80f698ac33e55d1d84b57eefc957b5acda29906b07bc0f8ef","observation_id":"294dfa43-2fb5-4597-919a-f216540ef309","resolution":{"observed_at":"2026-06-30T07:14:21.908023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08366","snapshot_observed_at":"2026-07-14T10:46:01.272433Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10569","last_updated":"2026-07-12T04:52:08Z","snapshot_observed_at":"2026-07-16T23:18:50.985927Z","submitted_at":"2026-07-12T04:52:08Z","title":"When Does Restricting a Coding Agent to execute_code Help? A Regime $\\times$ Agent-Design Ablation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T10:46:01.272433Z"},"links":{"cited_paper":"/paper/2605.08366","citing_paper":"/paper/2607.10569"},"observation_digest":"sha256:8841b71fdaff125348169ba365fec3d8e0cdad6fa520fa75559ac0e36055ebd4","observation_id":"b11d95bf-762f-4079-bb28-c455d6839b87","resolution":{"observed_at":"2026-07-14T10:46:01.272433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.08366/citation-record","integrity":"/paper/2605.08366/integrity","json":"/paper/2605.08366/citation-record.json","paper":"/paper/2605.08366"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.11562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:40:08.255305Z","title":"Prbench: Large-scale expert rubrics for evaluating high-stakes professional reasoning.arXiv preprint arXiv:2511.11562","venue":null,"work_id":"d0343a4c-9767-4d3c-ab40-27caf9931674","year":2025},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:700cc6e1b7b93e0a0a49be88a2a8b0780d3d49fcb0d3afac2940ece311bc356a","observation_id":"56292bef-5e22-4252-8759-1c949d248a61","resolution":{"observed_at":"2026-05-12T07:36:57.847129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing claude opus 4.7, Apr","venue":null,"work_id":"88b36948-0f12-42ef-b90d-86c4abd4227b","year":2026},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:b3549e85b5f9512896d601783c809346dba279139ec91cacdcfe6eb8a6fd82dd","observation_id":"5f2a342d-6475-4317-996f-ca3bbe51e136","resolution":{"observed_at":"2026-05-12T22:41:55.696349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":"2505.08775","doi":"10.48550/arxiv.2505.08775","metadata_source":"pith","pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-07-10T18:57:31.585722Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","venue":"cs.CL","work_id":"5d613c2c-158f-488c-9981-fc9b82a5e093","year":2025},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:b9771a904e55e5ad4bb568f6dfb20a7cb0f78acd8ac4b87f0e6620207a15f3b5","observation_id":"0efc71d9-0ca4-402b-a5bf-3238665eedfb","resolution":{"observed_at":"2026-05-13T05:18:21.444858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:81083422d6b929bee7c0ad2745ee81f3ca17d44b91884c090d6d3f356853e5d2","observation_id":"5b2e4bba-9e9a-4943-94d8-aba2c430a7df","resolution":{"observed_at":"2026-05-12T07:36:58.666806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20779","last_updated":"2026-04-22T17:08:19Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T17:08:19Z","title":"SWE-chat: Coding Agent Interactions From Real Users in the Wild","version":1},"cited_work":{"arxiv_id":"2604.20779","doi":"10.48550/arxiv.2604.20779","metadata_source":"pith","pith_arxiv_id":"2604.20779","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SWE-chat: Coding Agent Interactions From Real Users in the Wild","venue":"cs.AI","work_id":"b0d0ecba-07d5-485a-b8e5-53676267148d","year":2026},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2604.20779","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:69a367b76e984e919b2d93c3100edd66f8b6d12ec15e27f2e520a4555dfd0759","observation_id":"657e46b9-e7bd-4d55-9e99-c268c428a404","resolution":{"observed_at":"2026-05-12T07:36:58.596234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-07-06T13:42:40.131502Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:5b0620f87d7ae3563d277ce90c6c73ad02c52c672627756e38f48150b87901f2","observation_id":"d7527281-47b5-4fe4-8913-06b10116bfa6","resolution":{"observed_at":"2026-05-12T07:36:58.178943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03447","last_updated":"2025-01-07T00:24:07Z","snapshot_observed_at":"2026-07-06T20:17:24.683086Z","submitted_at":"2025-01-07T00:24:07Z","title":"CoReQA: Uncovering Potentials of Language Models in Code Repository Question Answering","version":1},"cited_work":{"arxiv_id":"2501.03447","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03447","snapshot_observed_at":"2026-07-02T09:16:49.249270Z","title":"CoReQA: Uncovering potentials of language models in code repository question answering.ArXiv, abs/2501.03447, 2025","venue":null,"work_id":"af855adf-3826-4d2c-ad71-c3fbd7b415cb","year":2025},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2501.03447","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:dc3ccef24bfb53b3e611af2c66bfca79dd8e7ae6ec01d776e252497e168df221","observation_id":"225ea043-a6d5-42f1-bfb9-5015aa20eba9","resolution":{"observed_at":"2026-05-12T07:36:57.999383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:b37fd1c80a8287e932ac388b3506b47d8ee58f023860c5659ca48e9f3a85d711","observation_id":"f0ab15bc-3c25-47f8-9f93-3c8d8cf7c18d","resolution":{"observed_at":"2026-05-12T07:36:56.886941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-11T10:18:59.594684+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T10:18:59.594684+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-07-06T22:30:21.881075Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":"2509.16941","doi":"10.48550/arxiv.2509.16941","metadata_source":"pith","pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-07-10T15:07:19.634552Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","venue":"cs.SE","work_id":"a561c78a-4b02-4053-a92a-bc5c7c5f6b9b","year":2025},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:50d3a5cae0dddfb052e72e151cfc4a8be37441c557f596686003ffcf3f1b0ea3","observation_id":"77150a33-e2b1-46f7-813a-1d98e59558ff","resolution":{"observed_at":"2026-05-12T13:48:53.849224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:48.977196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:48.977196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"cited_work":{"arxiv_id":"2506.11763","doi":"10.48550/arxiv.2506.11763","metadata_source":"pith","pith_arxiv_id":"2506.11763","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","venue":"cs.CL","work_id":"449edaa7-8f9d-4170-952d-4ab0d740572c","year":2025},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2506.11763","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:8c56359c165ba902f707262d8ea2bb89e502a16a151d9a0268a5c15204b3c743","observation_id":"065095c6-4494-408f-a292-10d8b7d6d7af","resolution":{"observed_at":"2026-05-16T08:07:39.643626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:29.66339+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:29.66339+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07832","last_updated":"2025-03-10T20:23:24Z","snapshot_observed_at":"2026-07-06T20:50:14.273421Z","submitted_at":"2025-03-10T20:23:24Z","title":"RefactorBench: Evaluating Stateful Reasoning in Language Agents Through Code","version":1},"cited_work":{"arxiv_id":"2503.07832","doi":"10.48550/arxiv.2503.07832","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07832","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Refactorbench: Evaluating stateful reasoning in language agents through code","venue":null,"work_id":"b1f9c3f8-00ea-469d-986f-06b67ac7cd64","year":2026},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2503.07832","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:a7270fd9fb3ab51823eca69fdd2b2c43fd3efca688b0edf88b87673f868669cc","observation_id":"9229fe0f-68cf-44af-b4c6-d7cc00c0e079","resolution":{"observed_at":"2026-05-12T07:36:56.777009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Harbor: A framework for evaluating and optimizing agents and models in container environments, Jan","venue":null,"work_id":"4b49284c-3435-445a-bf3e-2a08f3fac606","year":2026},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:1ca17a757840e1dd64094608a8863d731d9f7eec46b60c17200cf9ade197c81b","observation_id":"8e5939fc-e17f-4ff2-bb4f-b2d5b79de4b4","resolution":{"observed_at":"2026-05-12T22:41:55.737772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12415","last_updated":"2026-07-01T03:29:05Z","snapshot_observed_at":"2026-07-06T21:58:13.740929Z","submitted_at":"2025-07-16T17:05:17Z","title":"SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?","version":2},"cited_work":{"arxiv_id":"2507.12415","doi":"10.48550/arxiv.2507.12415","metadata_source":"pith","pith_arxiv_id":"2507.12415","snapshot_observed_at":"2026-07-10T19:57:33.782213Z","title":"Swe-perf: Can language models optimize code performance on real-world repositories?","venue":"cs.SE","work_id":"403dc7bd-a5c3-45f7-8504-6e9d910e99bd","year":2025},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2507.12415","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:be84d67a3cba49d0623e34b07e130d09b56388af2e65e30030d86dc1e98e76d8","observation_id":"71dc3abe-adcf-4cc1-a4a3-cc67fd7dc67e","resolution":{"observed_at":"2026-07-02T02:17:13.298963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:45.666457+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:45.666457+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:12ca3f75a86fe155f455631ef3ec7192eff114a151d82d31741872e88b0e5b6f","observation_id":"cfc4a9e8-f410-4eda-bd75-3b7a07cab414","resolution":{"observed_at":"2026-05-12T07:36:57.136309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":"2601.11868","doi":"10.48550/arxiv.2302.01973","metadata_source":"pith","pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-07-10T19:57:33.802494Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","venue":"cs.SE","work_id":"0624be05-1d97-4fd6-8300-b04b8a3ab04b","year":2026},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:4bf43e69001214b5fc1e518b0d776496d99ff806d5c5a0e350b351a77ff3448c","observation_id":"9460b06a-2718-4a8d-824e-c7412ab0b561","resolution":{"observed_at":"2026-05-12T07:36:58.326900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mündler, M","venue":null,"work_id":"7b48cd0e-ada0-47fa-b66d-3d28e98a42d4","year":2024},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:512c4557c355e1be773612a4ac4b953c7e0fea68a71d2d65fb79b55f815a7493","observation_id":"6177bc3f-664d-4376-b469-c1fb360c23b2","resolution":{"observed_at":"2026-05-12T22:41:55.758513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why we no longer evaluate SWE-Bench Verified","venue":null,"work_id":"989666fc-6602-4f57-a900-b6698db6b124","year":2026},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:e02c41c5ee23c16cd70c5dcc7fd9f9b78343597e2fb102c2f36cf35c7c290d23","observation_id":"7aa5ca77-9aa9-47bb-824d-6a09aeb831fc","resolution":{"observed_at":"2026-05-12T22:41:55.714887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.15887","doi":"10.48550/arxiv.2507.15887","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"K., Krupke, D., Kidger, P., Sajed, T., Stellato, B., Park, J., et al","venue":null,"work_id":"2c25f9d0-1696-48ff-a3b2-38c2e0d862c1","year":2025},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:57e96be3f04afa2a7ac86eb7eb10515a348efba65a0b25e3d3a7d0966f9dae87","observation_id":"a2678e27-ebae-4472-bdf5-e6652d8ab6f5","resolution":{"observed_at":"2026-05-12T07:36:58.056933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.04171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T22:08:59.886554Z","title":"Agentic Rubrics as contextual verifiers for SWE agents","venue":null,"work_id":"a269c83c-fd68-4722-ab1a-954b102bc4c6","year":2026},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:50111104d485c466ce77290f6626a482f8bbc75e112612c0e7345a4025a13fbb","observation_id":"92790d34-d7db-44ce-a2e8-38fc623cbc87","resolution":{"observed_at":"2026-05-12T07:36:57.292333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.24477","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T18:20:04.060272Z","title":"Composer 2 technical report","venue":null,"work_id":"2f0e7aac-32e7-44da-a464-190161471919","year":2026},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:71751bf953067ae5e228b7daa1f5df26d8b6b9dc676b2436b84f97b0c0ba638d","observation_id":"a6b33b32-257e-4c2a-ae51-7284741b7d9d","resolution":{"observed_at":"2026-05-12T07:36:58.826844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07685","doi":"10.48550/arxiv.2511.07685","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"ResearchRubrics : A benchmark of prompts and rubrics for evaluating deep research agents","venue":null,"work_id":"4b4b3d79-0d0f-4c57-9d4e-37ea9fad28af","year":2025},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:9c93947d8a5d162151b768a6b1f24a4809aa87c619f9640343c2b15660538762","observation_id":"6524ff53-25f6-435d-8ec4-faba32e96a70","resolution":{"observed_at":"2026-05-12T07:36:58.461918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7f00f345-b8c2-4e96-85d2-4c1f7cda7c81","year":2025},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:973c4f300a10dca23e5b75356992137c8c3485fb88f2b90d0407637a4c96e23b","observation_id":"99eaa7b0-5722-4396-a92a-02aa7ae6e15a","resolution":{"observed_at":"2026-05-12T22:41:55.686128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-07-06T18:50:52.800619Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":"2407.16741","doi":"10.1145/3718958.3750537","metadata_source":"pith","pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","venue":"cs.SE","work_id":"f1762ea0-e382-4f38-a28c-adc643789859","year":2024},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:521b714dbf541e9c8d12cad4c5fa0c340990e97de5bcf69b371635f14b972d99","observation_id":"a0aa8002-d60c-40ae-9011-c9187eedcd5d","resolution":{"observed_at":"2026-05-12T07:36:57.546350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01489","last_updated":"2024-10-29T17:29:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T17:24:45Z","title":"Agentless: Demystifying LLM-based Software Engineering Agents","version":2},"cited_work":{"arxiv_id":"2407.01489","doi":"10.48550/arxiv.2407.01489","metadata_source":"pith","pith_arxiv_id":"2407.01489","snapshot_observed_at":"2026-07-10T15:07:19.632010Z","title":"Agentless: Demystifying LLM-based Software Engineering Agents","venue":"cs.SE","work_id":"71c901c4-3c83-4e10-af54-3daef7fff397","year":2024},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2407.01489","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:efd4258ef281854356b36b4bdfd1868945c4c2ac6f7f67c048dfe2b3c59cfea5","observation_id":"868677a5-6baf-461b-94cf-600c9c894d93","resolution":{"observed_at":"2026-05-12T07:36:57.716234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:51.153796+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:51.153796+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03712","doi":"10.48550/arxiv.2602.03712","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":null,"venue":null,"work_id":"c1a4635d-1f04-4b22-b5dc-ca5b2584355a","year":2026},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:a0688f08d6c869e8d6b3ad9c95dc6e537809f07cf2eefc5a447490de851749f3","observation_id":"3bbce655-39b2-4d0f-bf44-10e16ea77dd6","resolution":{"observed_at":"2026-05-12T07:36:57.357719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"01844529-0000-43af-bd5f-30eec3ffa570","year":2024},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:9aecf61bd4c1e87cae7954812a84e1341daffab3cd71fa149a1117ea47d05580","observation_id":"d5f3545f-7cfd-40a8-be40-10bc9b7f84d4","resolution":{"observed_at":"2026-05-12T22:41:55.690111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21199","last_updated":"2024-12-31T08:20:42Z","snapshot_observed_at":"2026-07-06T20:14:49.976782Z","submitted_at":"2024-12-30T18:58:58Z","title":"HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation","version":2},"cited_work":{"arxiv_id":"2412.21199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.21199","snapshot_observed_at":"2026-06-29T14:33:31.671093Z","title":"Humaneval pro and mbpp pro: Evaluating large language models on self-invoking code generation","venue":null,"work_id":"f85900bb-7565-4bf9-a7a0-f05e36feb038","year":2025},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2412.21199","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:e0706d1e45dedcca87ebb9302e8684f9699057c6707510153fe06b71a3197ae1","observation_id":"4524c26e-f802-4aa7-888b-6e408c19af54","resolution":{"observed_at":"2026-05-12T07:36:57.029369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02605","last_updated":"2025-04-03T14:06:17Z","snapshot_observed_at":"2026-07-06T21:03:40.343637Z","submitted_at":"2025-04-03T14:06:17Z","title":"Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving","version":1},"cited_work":{"arxiv_id":"2504.02605","doi":"10.48550/arxiv.2504.02605","metadata_source":"pith","pith_arxiv_id":"2504.02605","snapshot_observed_at":"2026-07-10T15:07:19.624548Z","title":"Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving","venue":"cs.SE","work_id":"c66ce635-0931-4807-8300-a45863330d75","year":2025},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2504.02605","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:0d2c4ed4449d7f1c6e6c765fed1ed090d1e37878b7f35776afa2157a5cbe5e49","observation_id":"d57a25cb-13d9-47dd-9799-c09bb5edde44","resolution":{"observed_at":"2026-05-16T06:48:50.578231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.442994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.442994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"02aea32c-3405-4188-bf8e-bee1cded9b08","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:dc530c889375be64e8d24beb2e94d592580d10e6c56dc53478e803bc629c5c7c","observation_id":"424ce682-22a5-4680-84fa-d24f658f4712","resolution":{"observed_at":"2026-05-12T22:41:55.723140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e1f254b9-fb42-4cb5-86eb-cb7b879c0b4e","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:c00c53e082743681d07c8b9f9fa88dc8105dabb8a650c8a03b70af55a6ae110f","observation_id":"ad7999a4-8188-4392-9a93-1bbbb6639b6c","resolution":{"observed_at":"2026-05-12T22:41:55.719269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I’m pulling exact line numbers from the scheduler, rule routine, ﬁngerprint, and state-manager paths now","venue":null,"work_id":"96fd95c6-5784-4b88-8938-a25e525e31e9","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:89e761697519e17141f5dba73a133649e1f39bd6ce8289de1f54d34c9d4a55f5","observation_id":"5603ec0a-7e0d-4c4d-ad87-c137a12439bd","resolution":{"observed_at":"2026-05-12T22:41:55.668545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Extracts the local buffer implementation from`pkg/gitparse/gitparse.go`into a shared package","venue":null,"work_id":"6ac69716-0f70-4458-b59a-2c035f3de499","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:5283dc769420485ced59b90dbe620fe7ce621da878349b3e8289859b7c28223d","observation_id":"2f581a2f-f86e-4a36-9dec-c4a469b7b234","resolution":{"observed_at":"2026-05-12T22:41:55.730121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Does NOT introduce a new dependency on`unsafe`Rust code in the refactored module","venue":null,"work_id":"8725111b-023f-4d34-b12f-2c6369873b7c","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:36c118ab7be00301781651dbd6a5056dd781efc15109f376202c58965c6b6d41","observation_id":"ea5de3c0-e5cd-4fc8-8786-8fac368e8e3d","resolution":{"observed_at":"2026-05-12T22:41:55.754888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"995938ab-fa93-45b2-96aa-dad30c0deb90","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:f23cda962ad881f944d59990e32863369a8a1388f0bb42f85492b9b7417acc22","observation_id":"7c8f7b91-e36e-486b-b8b5-9303112b5271","resolution":{"observed_at":"2026-05-12T22:41:55.704765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cda1f94c-9e28-43d7-9bcb-dbce6e35e730","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:9a296463084dbee92204d6801ad8ab12ae78261f872e4fbe6b66a525f14cb9bf","observation_id":"55da77df-5f1b-4374-96e8-6fe9cffba4bf","resolution":{"observed_at":"2026-05-12T22:41:55.647582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"483dbdde-e568-49f7-b9eb-20151aa32e6d","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:3539a523b1f10400362738877b302bd72cba694a371e5c703d840f7d57d7478b","observation_id":"06f4ecff-42a7-41be-88cb-3d11c603bff4","resolution":{"observed_at":"2026-05-12T22:41:55.677380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9c6a061c-d377-4849-b9d2-04cacb36c6bd","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:95fa7626b8c28bc00cfe7259f70c3c5d1da2094ec1542fd4fdb80fc32cb6283c","observation_id":"0010f06a-aaab-48e5-8166-1552acefbfff","resolution":{"observed_at":"2026-05-12T22:41:55.664770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1.1\" importance: must have text: Reports how the scheduler decides what to work on next (e.g., ready set returned by processTick, rule selection per tick). - id","venue":null,"work_id":"78457a77-7994-4f74-9079-86f18b2a6ae4","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:7f9d1b7f55bbff0401b3f0cd70a6685a0d8443a9f722770b7c4cfcb9c0e1215b","observation_id":"8d0c72c3-aa41-465d-b77d-686ea5d53261","resolution":{"observed_at":"2026-05-12T22:41:55.700671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"882689df-a180-424e-8edb-695970700f5b","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:153a7331f491785463a557d15c2ce493a9d8d82ee523e400585897fbca0b4618","observation_id":"a45326ee-917c-45bd-ab46-e5078a76dd3f","resolution":{"observed_at":"2026-05-12T22:41:55.733393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This differentiates it from PerVUIterations executor","venue":null,"work_id":"1f8362fa-0a8e-4c00-8dd7-ad7ecf0f04ef","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:94a31fb620c8ab660e524a6e9b0d6bebc41cc6e27383b442b1027a96c616ba74","observation_id":"8a6f86ff-e478-4c86-bb3b-3665e2bcf481","resolution":{"observed_at":"2026-05-12T22:41:55.709138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c02cec10-46e4-4c87-9004-615af8c4d87d","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:e8ef6979b2f0945240b5246365d44dceae75270a8858bae27e205951e0d0451f","observation_id":"078d593a-5c6a-4e73-9a60-ce29795cb5cf","resolution":{"observed_at":"2026-05-12T22:41:55.643682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"db7fb688-703d-440c-8af8-a76551e64126","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:5e957dc74a65afb843be85ee89ba24c3e75e21542c510a4a2aea1a37e8f435fe","observation_id":"2f7c61dd-8112-4575-93d5-d09383652dda","resolution":{"observed_at":"2026-05-12T22:41:55.655054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f5733950-6378-4f99-8ac6-5b136d60fa9f","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:34e007a37ecc37cadf415761effa7e9656049d6e284377d204a71146db968dec","observation_id":"6ad7c681-b216-49c5-835b-92dc065d7335","resolution":{"observed_at":"2026-05-12T22:41:55.750497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3eec58ab-c511-4627-ba17-8c0e31b9a155","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:8e30c3eb3f507f9485895d1fc452d4274993cd24f9db3e1ab9acf2fee53475a7","observation_id":"2793618c-a654-4890-a72e-9593d80a9dec","resolution":{"observed_at":"2026-05-12T22:41:55.651164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"05d58282-436d-4820-82f1-111c850b807c","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:53222c263aa0ed23bbe035224d3f129c55c28393fb792103a2636add12ef7aa5","observation_id":"b4de9f54-e8f6-4060-bd5b-62d038793f42","resolution":{"observed_at":"2026-05-12T22:41:55.658562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7aaf5e07-9d2e-4187-a273-3661f425e064","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:580837b32e9da8bd0f6df896452653f7c24b85daa35259f8a8c7b252fe980c91","observation_id":"f54ff545-2500-4dc4-b4a4-b13de9e22288","resolution":{"observed_at":"2026-05-12T22:41:55.740760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e6bcf7e1-b0f4-4776-b70a-112434625483","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:14f46100c619bdbcfb4d79464bd8f5f5b967341e7eeccd84f1d160ff8f94c44a","observation_id":"8a2b29b4-9742-44e5-a3b9-807efa7e3159","resolution":{"observed_at":"2026-05-12T22:41:55.743525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"describe block > it/test name","venue":null,"work_id":"a1cc6c71-98c4-4518-b3de-70e7fa87756d","year":null},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:863c5ea9ebbb9394ceb5f21548b12e91a9120b0467cdf8f8c9083c95f1a1cec2","observation_id":"fbedc63e-fe7c-4def-8252-a3b134cf7e89","resolution":{"observed_at":"2026-05-12T22:41:55.746179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":22,"verified_fuzzy":26},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 48 of 48 outbound references and 3 inbound Pith citation observations for arXiv:2605.08366."}