{"as_of":"2026-08-05T14:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9324d8f09b68329d29922578c528093b604ab61708dbd82b93c5707a48765c95","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":59,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:54:06.577486Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2408.15549","last_updated":"2026-04-17T16:47:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-28T05:53:46Z","title":"WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-23T22:37:43.230753Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2408.15549"},"observation_digest":"sha256:afd22b198f39bec002d1028dce8b456a35e84f6c681dbc7f4cde6117291b1549","observation_id":"150b4d26-5c42-4ba8-94fb-d21ca507c1d3","resolution":{"observed_at":"2026-05-23T22:38:32.638248Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T06:25:00.376073Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2412.15115"},"observation_digest":"sha256:6b3070a712784841bc95c91575277c9d90423dd75e4e4e5e60863c1dadf1bdc8","observation_id":"3a66b36c-cc5e-4138-9e7e-22e305edfa49","resolution":{"observed_at":"2026-05-23T06:25:27.947989Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T05:25:59.964619Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2501.15383"},"observation_digest":"sha256:3021e1c24cfea7e30ead3d976ceecf83b3d714cc219fee302df6cdd31efbfe74","observation_id":"bfffb73e-a91b-4d2c-9bf9-2f37f60fd8bc","resolution":{"observed_at":"2026-05-15T05:26:00.110871Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-11T20:23:30.763794Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2502.01456"},"observation_digest":"sha256:fc0389c7a1681b0b9131963810c968a6718b48aac576136efa7c91b551a445fb","observation_id":"915dee21-dd03-4714-be41-7f53fe0437df","resolution":{"observed_at":"2026-05-11T20:23:31.052021Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2504.13217","last_updated":"2026-05-18T14:05:55Z","snapshot_observed_at":"2026-08-01T15:57:04.534831Z","submitted_at":"2025-04-17T04:00:40Z","title":"Sustainability via LLM Right-sizing","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T19:24:58.690462Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2504.13217"},"observation_digest":"sha256:922dea2984cab66ea35d2b92391e6b84cc73445b005ee92703782ebdbbdf9945","observation_id":"55aeaf3a-e86c-4f12-a57e-ba7685092167","resolution":{"observed_at":"2026-05-22T19:25:03.708397Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2504.21318","last_updated":"2025-04-30T05:05:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T05:05:09Z","title":"Phi-4-reasoning Technical Report","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T03:40:25.706499Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2504.21318"},"observation_digest":"sha256:faeac33fbb15fe5c2727eb3b7764557a3df6c4fc632025935c2061a57a032845","observation_id":"09202a5b-c0cc-48c2-9a0a-a4cd1f7c70c5","resolution":{"observed_at":"2026-05-17T03:40:25.802248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T06:35:27.813995Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2505.09388"},"observation_digest":"sha256:6af0505d82dad3efb984a05f378cd96e1ae21c47f704349f6a1134e3290984a5","observation_id":"eb5e6986-17d3-4e71-9ca3-c7408c504eac","resolution":{"observed_at":"2026-05-09T06:35:28.553855Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2506.18841","last_updated":"2026-04-08T11:33:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T16:59:02Z","title":"LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T07:51:35.381534Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2506.18841"},"observation_digest":"sha256:33b414b6e55e629f029d67262bd95142561f975ea68e5d14d2e467fa0b757564","observation_id":"8b5ed6e6-6b0c-464c-b770-dd1aafc19f5c","resolution":{"observed_at":"2026-05-19T07:52:09.341813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T17:49:27.926646Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2507.20534"},"observation_digest":"sha256:cb5f68cbb4be484c60ee66515cf3aa41f2ab139cce7dce408c3d80c1d7983ea9","observation_id":"3d33e227-dec6-4543-86e2-fbec5e4d4459","resolution":{"observed_at":"2026-05-10T17:49:28.169833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2508.17784","last_updated":"2026-04-12T14:04:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T08:26:43Z","title":"Proximal Supervised Fine-Tuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T20:42:14.423836Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2508.17784"},"observation_digest":"sha256:c0b8a6084abdd82cd1671d2e174a0e4b8e2c2aa46e1d8e1cffe0923f4ceaeff1","observation_id":"cb8280bf-0f5e-4da0-8588-7113be70383b","resolution":{"observed_at":"2026-05-18T20:42:50.861827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T11:50:16.737789Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02208","last_updated":"2025-09-02T11:23:35Z","snapshot_observed_at":"2026-08-05T11:50:10.014003Z","submitted_at":"2025-09-02T11:23:35Z","title":"Baichuan-M2: Scaling Medical Capability with Large Verifier System","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:16.737789Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2509.02208"},"observation_digest":"sha256:5653d2e9f8424ff48dbe6be596b81d7b5fbd0216fb7a5b84724e60f9877bd64e","observation_id":"d6fb6c37-593f-41ed-9d42-74e73f74a884","resolution":{"observed_at":"2026-08-05T11:50:16.737789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T10:16:51.162616Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04292","last_updated":"2025-09-04T15:03:02Z","snapshot_observed_at":"2026-08-05T10:16:49.456200Z","submitted_at":"2025-09-04T15:03:02Z","title":"Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:16:51.162616Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2509.04292"},"observation_digest":"sha256:9e372e974678103bb376845301ad086166233e793d7a208e66682baa266fecb1","observation_id":"03a7378c-57aa-44c9-b17b-fe7aa3bd19e9","resolution":{"observed_at":"2026-08-05T10:16:51.162616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T12:54:06.577486Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06982","last_updated":"2025-09-01T04:50:02Z","snapshot_observed_at":"2026-08-05T12:54:05.411254Z","submitted_at":"2025-09-01T04:50:02Z","title":"CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:54:06.577486Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2509.06982"},"observation_digest":"sha256:752e0a3e93981991ebb1764106227e925ed7e949c89525c3bf0379a91b468ddc","observation_id":"3d12ec89-33da-4276-9312-b039b62a3923","resolution":{"observed_at":"2026-08-05T12:54:06.577486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-04T16:07:33.334341Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.334341Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:f0bb4c09f9cf8758cf00d6b1ac2552f4d4327e653ba68f9b43c271ee6f806549","observation_id":"d8a6185a-fc02-4d71-8a46-355ab7680a42","resolution":{"observed_at":"2026-08-04T16:07:33.334341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-04T10:56:37.225419Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07884","last_updated":"2026-07-28T08:23:49Z","snapshot_observed_at":"2026-08-04T10:56:34.378811Z","submitted_at":"2025-10-09T07:37:23Z","title":"Contrastive Weak-to-strong Generalization","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T10:56:37.225419Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2510.07884"},"observation_digest":"sha256:27cf4707601ff0e0244d4effe38f94fe142f8f281ac3b207447012eb5b6c33fc","observation_id":"54fdf2cd-095e-4648-8f58-8eb2e51a44ed","resolution":{"observed_at":"2026-08-04T10:56:37.225419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-04T09:28:12.935875Z","title":"From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15514","last_updated":"2026-05-24T15:31:17Z","snapshot_observed_at":"2026-08-04T09:28:11.420694Z","submitted_at":"2025-10-17T10:34:59Z","title":"Voting with the Graph: Stable RLAIF via Topological Consistency Maximization","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T09:28:12.935875Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2510.15514"},"observation_digest":"sha256:4aefa86385970326f1a1650644ad49bb46ab1806af9851c08b90038a27032118","observation_id":"bd9fb3b9-dc58-47a8-bd0d-15bc26f08b35","resolution":{"observed_at":"2026-08-04T09:28:12.935875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:9f6b990d199634f5026340e25796ade9c71b587bad27ee87f8418f4a548349af","observation_id":"dfe06954-e8e9-47ef-bd0a-e0287188fce7","resolution":{"observed_at":"2026-05-16T21:48:34.399906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-04T17:10:53.354037Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T19:12:24.627033Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2601.08584"},"observation_digest":"sha256:4609b72fa5106eaf0df589ecdf2b39b2ee079cf8620753c930a66532deb448ca","observation_id":"703538fa-5ddd-4fc9-8533-c7e19f6254b9","resolution":{"observed_at":"2026-05-14T19:12:24.737310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2604.07054","last_updated":"2026-04-09T07:49:38Z","snapshot_observed_at":"2026-08-02T09:08:32.703047Z","submitted_at":"2026-04-08T13:06:37Z","title":"Sell More, Play Less: Benchmarking LLM Realistic Selling Skill","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-10T17:36:10.725278Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2604.07054"},"observation_digest":"sha256:23d7b7fa48cdb2e01ba8b15cfd293945a49641e4706df6541b2b3dfb32d7cae0","observation_id":"5581cca9-6475-4b63-9926-4bb09db415d1","resolution":{"observed_at":"2026-05-11T06:31:02.345859Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2604.16790","last_updated":"2026-04-18T02:35:05Z","snapshot_observed_at":"2026-07-06T23:04:01.558812Z","submitted_at":"2026-04-18T02:35:05Z","title":"Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T07:29:03.994957Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2604.16790"},"observation_digest":"sha256:b9ffbcf9ccf23ddce8575e4de4ccdd561a493ab43bc54fd3442f46fd8edd5ea0","observation_id":"089bb7d7-f02f-4bdb-b5cc-f0e1f45ecb87","resolution":{"observed_at":"2026-05-10T07:32:00.320382Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2604.20244","last_updated":"2026-04-22T06:46:22Z","snapshot_observed_at":"2026-07-06T23:06:44.624357Z","submitted_at":"2026-04-22T06:46:22Z","title":"Hybrid Policy Distillation for LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-10T00:41:21.984760Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2604.20244"},"observation_digest":"sha256:372c29717834f080d16940c6aa22b67e43978ef97799e3ef9639b875691d002d","observation_id":"fa042987-fbf5-4573-a1b9-ed7d3f261a59","resolution":{"observed_at":"2026-05-10T00:54:49.037705Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2604.22597","last_updated":"2026-04-24T14:25:01Z","snapshot_observed_at":"2026-07-06T23:08:56.419589Z","submitted_at":"2026-04-24T14:25:01Z","title":"Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-08T11:45:54.181019Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2604.22597"},"observation_digest":"sha256:efd105ee6f1d6c995f63592c55b50c44e644358dc5a396307b1e630149b1bb51","observation_id":"9c0fd436-e9ab-4a91-8650-a5d6a8307059","resolution":{"observed_at":"2026-05-11T19:31:09.395945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2604.24700","last_updated":"2026-04-27T17:04:17Z","snapshot_observed_at":"2026-08-04T04:55:30.006592Z","submitted_at":"2026-04-27T17:04:17Z","title":"Green Shielding: A User-Centric Approach Towards Trustworthy AI","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-08T03:43:54.896449Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2604.24700"},"observation_digest":"sha256:e6341d9be9b27f5914f2056611659fad494a1d3d61f2c1603d5a1d5a92bc2ceb","observation_id":"8871aed4-4f44-4ffc-a9fc-5b617c51f5e6","resolution":{"observed_at":"2026-05-11T21:56:23.131233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.02209","last_updated":"2026-05-04T04:17:02Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T04:17:02Z","title":"Submodular Benchmark Selection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T19:23:51.649257Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.02209"},"observation_digest":"sha256:be47816bfc3517ad4411eee84988bf20cec682dbaa0c1312454e1d9e20067fb0","observation_id":"c1b00215-5dcc-4705-b4fb-ade79a9b547b","resolution":{"observed_at":"2026-05-09T05:55:30.262305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.04454","last_updated":"2026-05-06T03:28:30Z","snapshot_observed_at":"2026-08-04T06:38:56.344758Z","submitted_at":"2026-05-06T03:28:30Z","title":"Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T18:11:42.971428Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.04454"},"observation_digest":"sha256:de00f4656bda13df829b4b03f2e72954709fc6f4254a7da08d2cccb1135b97d3","observation_id":"bb0e6e62-fdbf-4a77-af71-1215e91bf39c","resolution":{"observed_at":"2026-05-09T06:40:43.241242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.07268","last_updated":"2026-05-08T05:33:58Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T05:33:58Z","title":"From 0-Order Selection to 2-Order Judgment: Combinatorial Hardening Exposes Compositional Failures in Frontier LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T02:35:11.605353Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.07268"},"observation_digest":"sha256:0321b9529fc9e6d664f38f584cf825d0fb7d9514970ee2c01bd6d546463173fe","observation_id":"47b82246-5b1e-4394-989d-8d235c1ed755","resolution":{"observed_at":"2026-05-11T03:15:55.889914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.07731","last_updated":"2026-05-20T09:02:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T13:36:24Z","title":"Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T03:40:04.692279Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.07731"},"observation_digest":"sha256:b2ad939a6d83d8618a6e8dda526033a2b72d72c1431d597e885a8d049f8b0322","observation_id":"43bb4391-584d-4cbf-91b5-6565d03035f7","resolution":{"observed_at":"2026-05-11T03:40:53.402757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.07731","last_updated":"2026-05-20T09:02:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T13:36:24Z","title":"Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T08:14:55.858466Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.07731"},"observation_digest":"sha256:540bff1d325c5e1a1615fc40f8df9f79569e1487e377126212f5d2fa7409f946","observation_id":"48717c06-398c-4f3e-8631-87c7c59b50fd","resolution":{"observed_at":"2026-05-21T08:19:52.930353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.08378","last_updated":"2026-05-08T18:36:25Z","snapshot_observed_at":"2026-08-02T18:04:56.183678Z","submitted_at":"2026-05-08T18:36:25Z","title":"Reinforcement Learning for Scalable and Trustworthy Intelligent Systems","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-12T01:47:40.772146Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.08378"},"observation_digest":"sha256:28b9dcacc474e36ce46775a6a3784ab3ac24f833de8343179139775037c0e4e3","observation_id":"f3bd7a5a-3a1a-49fb-88ae-b90854a4275b","resolution":{"observed_at":"2026-05-12T07:51:39.616715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.15482","last_updated":"2026-05-21T18:49:22Z","snapshot_observed_at":"2026-07-06T23:26:46.595393Z","submitted_at":"2026-05-14T23:53:51Z","title":"FINESSE-Bench: A Hierarchical Benchmark Suite for Financial Domain Knowledge and Technical Analysis in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T14:32:01.939211Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.15482"},"observation_digest":"sha256:8faf9f20a353d0835febe77bda550210c58d616373923481810a94c766e16387","observation_id":"182e70c3-1210-4a7d-9b83-492096619b90","resolution":{"observed_at":"2026-05-19T14:32:36.155297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.15482","last_updated":"2026-05-21T18:49:22Z","snapshot_observed_at":"2026-07-06T23:26:46.595393Z","submitted_at":"2026-05-14T23:53:51Z","title":"FINESSE-Bench: A Hierarchical Benchmark Suite for Financial Domain Knowledge and Technical Analysis in Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T05:44:59.785603Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.15482"},"observation_digest":"sha256:153ec4ff2b82fa1aba49a65abf78dfaf2ec107ff84c10fcc4d04839aeb0ff555","observation_id":"23c182b7-74d4-464e-9b92-f868d5b26276","resolution":{"observed_at":"2026-05-25T05:45:23.428842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.18630","last_updated":"2026-05-18T16:34:45Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T16:34:45Z","title":"SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T10:36:09.724234Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.18630"},"observation_digest":"sha256:93b61f7be9ab2f381614cffaa34da5249a0c649aa9ad0d5e34275d4e0f5176ad","observation_id":"7401ba63-e9cc-4b6a-8633-98ca2216df68","resolution":{"observed_at":"2026-05-20T10:38:12.088921Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.18660","last_updated":"2026-05-18T17:08:10Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T17:08:10Z","title":"Evaluating Multi-turn Human-AI Interaction","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-20T08:33:08.019966Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.18660"},"observation_digest":"sha256:f482fe5c7506701d65e3f1f3a6d85b980cd61922c1d94d3ecec5898af717b72a","observation_id":"e10e47c4-ad36-42df-954b-a0861f3837fc","resolution":{"observed_at":"2026-05-20T08:33:24.478464Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.18721","last_updated":"2026-05-21T04:23:01Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:50:27Z","title":"General Preference Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T12:43:56.522345Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.18721"},"observation_digest":"sha256:49a9d64b9bdd4a687628534ca73d62600a7916c44547e5130afbd4a0d727d6fd","observation_id":"df75fa0a-181a-4f21-947d-94df2b9cf2a6","resolution":{"observed_at":"2026-05-20T12:48:17.732214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.18721","last_updated":"2026-05-21T04:23:01Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:50:27Z","title":"General Preference Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T07:50:00.963837Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.18721"},"observation_digest":"sha256:a206b3515a5dd4234568de810d845193e669b8adfdcece3f8c000e90349542fa","observation_id":"d539ea44-739e-4de8-bb4c-be49c2195121","resolution":{"observed_at":"2026-05-21T07:54:02.908526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.18721","last_updated":"2026-05-21T04:23:01Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:50:27Z","title":"General Preference Reinforcement Learning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T09:24:39.228616Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.18721"},"observation_digest":"sha256:203de8b4daabe439c1b4159d4a345f1a1fe8d34c0b591a108d950834fcb49307","observation_id":"591565b8-f68b-4c8d-b1bc-d8cd14fa2332","resolution":{"observed_at":"2026-05-22T09:24:45.730861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.18904","last_updated":"2026-05-17T13:36:53Z","snapshot_observed_at":"2026-07-31T21:47:41.038897Z","submitted_at":"2026-05-17T13:36:53Z","title":"Dynamic Model Merging Made Slim","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T15:16:24.651868Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.18904"},"observation_digest":"sha256:991b8b5df5d4e2b1a6b4a31455bf777f5c936715b726ae036380fbb66c9fde7a","observation_id":"5297ffe4-e718-43af-9689-c1f2154f1c20","resolution":{"observed_at":"2026-05-20T15:18:25.364526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.19099","last_updated":"2026-05-18T20:37:14Z","snapshot_observed_at":"2026-07-31T05:54:44.970755Z","submitted_at":"2026-05-18T20:37:14Z","title":"DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T10:16:38.920528Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.19099"},"observation_digest":"sha256:b86c2dbb6de02d09fa3261b69cdda836e6399ecad3fd9b778066d94bdeb2dc98","observation_id":"319eb073-2cef-4b97-b614-42ae03fdd845","resolution":{"observed_at":"2026-05-20T10:18:11.754889Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.21086","last_updated":"2026-05-20T12:21:15Z","snapshot_observed_at":"2026-07-06T23:31:37.061253Z","submitted_at":"2026-05-20T12:21:15Z","title":"LoCar: Localization-Aware Evaluation of In-Vehicle Assistants through Fine-Grained Sociolinguistic Control","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-21T05:02:31.689194Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.21086"},"observation_digest":"sha256:cab171d8ee67fea47737e3bdca54cadcd3f7ec45a4bccc9069e7afe30420585a","observation_id":"23c382d4-2f54-499e-aa10-ad8029cfa605","resolution":{"observed_at":"2026-05-21T05:03:57.885621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.23244","last_updated":"2026-05-22T05:25:00Z","snapshot_observed_at":"2026-08-01T14:10:27.190441Z","submitted_at":"2026-05-22T05:25:00Z","title":"Convex Optimization for Alignment and Preference Learning on a Single GPU","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-25T05:01:31.560963Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.23244"},"observation_digest":"sha256:616eda104274a7cf56e38e4829ea5cd81fbe56d47bb5bc6efb1bafe2f5103ee7","observation_id":"fac8b699-6e06-4fa2-a028-7ea85e13cde0","resolution":{"observed_at":"2026-05-25T05:06:38.363145Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.29156","last_updated":"2026-05-27T22:46:25Z","snapshot_observed_at":"2026-08-02T19:31:57.951767Z","submitted_at":"2026-05-27T22:46:25Z","title":"RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T13:13:57.012665Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.29156"},"observation_digest":"sha256:bbb81c88265120324746e491bbbe2228312f8aae36409bf0dcda8d17f83655bb","observation_id":"0b55b1ef-e633-4ecb-9a32-28ec230b4a15","resolution":{"observed_at":"2026-06-29T13:23:28.534671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2605.29277","last_updated":"2026-05-28T02:52:58Z","snapshot_observed_at":"2026-08-02T07:14:00.912490Z","submitted_at":"2026-05-28T02:52:58Z","title":"Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T07:00:07.102425Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2605.29277"},"observation_digest":"sha256:f80754c7ed0cf1caac79f89c496af5ece09865ffd4b1d29f6dbd83ddd2ea7bd2","observation_id":"3e6b3b05-f573-4c49-aca5-e052215d7380","resolution":{"observed_at":"2026-06-29T07:03:12.895998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2606.10528","last_updated":"2026-06-09T07:57:50Z","snapshot_observed_at":"2026-07-06T23:49:41.940954Z","submitted_at":"2026-06-09T07:57:50Z","title":"Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T13:39:17.701196Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2606.10528"},"observation_digest":"sha256:dce39712e3e5612239acca9a68caed05b433fc62f526062c712b6165b9f15db9","observation_id":"3ced6e07-2f39-4cba-8b02-21f44c4b0f33","resolution":{"observed_at":"2026-07-03T04:47:38.285243Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-06-09T21:59:37Z","snapshot_observed_at":"2026-07-06T23:50:35.052764Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:46883c6c1bf46058331d8e17767aba23add64798c80058c498b3ff68fd758dc7","observation_id":"53eb0049-3436-400a-923a-e60e5496545c","resolution":{"observed_at":"2026-07-03T05:57:41.357282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2606.15079","last_updated":"2026-06-13T03:21:49Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-13T03:21:49Z","title":"Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale","version":1},"reference_index":202,"source":"arxiv_source","source_observed_at":"2026-07-02T22:10:59.568675Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2606.15079"},"observation_digest":"sha256:3405bdbd0e711cee523fced03987c6dc07c16d68a5c3e30e889a57184c596764","observation_id":"6e7a757e-2aea-482a-a65c-7626f779eeab","resolution":{"observed_at":"2026-07-02T22:17:25.498883Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2606.17162","last_updated":"2026-06-15T18:02:55Z","snapshot_observed_at":"2026-08-01T11:32:11.709711Z","submitted_at":"2026-06-15T18:02:55Z","title":"MemSlides: A Hierarchical Memory Driven Agent Framework for Personalized Slide Generation with Multi-turn Local Revision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T03:43:37.671325Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2606.17162"},"observation_digest":"sha256:d6df456deb59fb6af6f207db5b8c56fa66d15e8fe879a47e8f1f375cb57ab3ad","observation_id":"49ffdf7e-6211-4214-b304-609968163117","resolution":{"observed_at":"2026-07-03T17:48:46.040647Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2606.17453","last_updated":"2026-06-17T07:21:04Z","snapshot_observed_at":"2026-07-06T23:53:02.028020Z","submitted_at":"2026-06-16T03:14:39Z","title":"MapSatisfyBench: Benchmarking Satisfaction-Aware Map Agents through Behavior-Grounded Implicit Decision Factors","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T01:33:18.750759Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2606.17453"},"observation_digest":"sha256:a24f99786fd4a47cfc984dd72bf3cfcfa6aa9ab4b06de3fade62fd681e1d304d","observation_id":"a84e85a0-e0ce-4ecf-8883-28cce51764c2","resolution":{"observed_at":"2026-07-03T20:08:56.728217Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-08-02T05:34:02.324381Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:47cb924546a7b66ee2289de1d698f68d5845ac1d71cf253ac88ce5dd91697afb","observation_id":"55cfe3bd-196c-4919-abf4-5e08550773f7","resolution":{"observed_at":"2026-07-04T15:49:58.280215Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":206,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:300b8149ae383d3892b2fe3b063e2d3eee31beee3000723b1ee7ac5bd4d5f89e","observation_id":"056f5a06-e39e-4dbb-9fbc-67ddff6aa74e","resolution":{"observed_at":"2026-07-08T00:04:22.579558Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2406.11939 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":206,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:fa9796fec9f496d2493dff8c042395a792cbbb05db2ec74fd0ffbabf7ac5c1f0","observation_id":"259eff52-fcb8-41da-b6b4-1af6fef2230a","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-07-11T07:02:51.036489Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-07T12:47:29.552283Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:590d51bfcc00c1d141c8479cf040688cda7aa321b1058c4198657197001b5a39","observation_id":"97ec935e-ccad-4508-8472-c7839b1c644b","resolution":{"observed_at":"2026-07-07T12:53:50.140692Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-07-11T07:02:51.036489Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:3f281988955e0e7c230843efcca6338bd02075679e0928df70e57155f3edf69c","observation_id":"2114fef4-2e7f-4078-bc10-19361bce13f5","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-07-14T06:40:17.865408Z","title":"Li, W.-L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11151","last_updated":"2026-07-13T06:46:56Z","snapshot_observed_at":"2026-07-16T23:19:13.693221Z","submitted_at":"2026-07-13T06:46:56Z","title":"AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T06:40:17.865408Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.11151"},"observation_digest":"sha256:877d7b1546550d286cb88c1e513481dc22485d47e0a7d02520ee3f5bbfbf5c0c","observation_id":"9c0c2c1a-3e45-4cab-a8b8-87cc5ffaeeca","resolution":{"observed_at":"2026-07-14T06:40:17.865408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-02T15:39:38.560563Z","title":"17 Tianle Li, Wei-Lin Chiang, Evan Frick, Lisa Dunlap, Tianhao Wu, Banghua Zhu, Joseph E Gon- zalez, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-04T02:00:04.184509Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:38.560563Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:b95a47625e0859dcb84eeb8890860d3036d876eac1e1d0786a2bb86c8a3777e8","observation_id":"67cd5d86-b2b8-4b58-bc41-af628a67289c","resolution":{"observed_at":"2026-08-02T15:39:38.560563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-01T15:29:24.224184Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-04T02:52:47.040983Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:24.224184Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:b52db6548844d1ac2a3c08bf5f47b70672afe3b0029ef6169a84c5cd418b428d","observation_id":"aa2f134a-7b0c-48a9-8009-f1286765e82f","resolution":{"observed_at":"2026-08-01T15:29:24.224184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-01T13:53:46.138863Z","title":"From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline.arXiv preprint arXiv:2406.11939, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18985","last_updated":"2026-07-25T09:51:58Z","snapshot_observed_at":"2026-08-04T09:24:33.312017Z","submitted_at":"2026-07-21T11:19:21Z","title":"Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interaction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:46.138863Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.18985"},"observation_digest":"sha256:11942ad1463875bd128e853e374e8b485267f74412ca0a674a042d93e75f525a","observation_id":"1647cdb6-48cf-411c-936e-adf1b43b68e1","resolution":{"observed_at":"2026-08-01T13:53:46.138863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-02T09:51:06.050155Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19375","last_updated":"2026-06-26T22:26:40Z","snapshot_observed_at":"2026-08-03T02:46:20.183203Z","submitted_at":"2026-06-26T22:26:40Z","title":"Economic Evaluations of Language Models","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-02T09:51:06.050155Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.19375"},"observation_digest":"sha256:8ba7fe0d23b1bc2509dddc4b678886a724b3b4a5748449e79cda8d55154f0050","observation_id":"c2e4800d-3335-4c2f-a66d-d3be96e90501","resolution":{"observed_at":"2026-08-02T09:51:06.050155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-02T13:36:53.993819Z","title":"and Stoica, Ion , month = oct, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21610","last_updated":"2026-05-20T04:43:02Z","snapshot_observed_at":"2026-08-02T13:36:51.796140Z","submitted_at":"2026-05-20T04:43:02Z","title":"SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T13:36:53.993819Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.21610"},"observation_digest":"sha256:8a7905c9fd19c3f8e19582dafa4a8cd13c8940e808fcb41bba37cd7e6c238a8e","observation_id":"ff7d2a22-4f31-4eb7-b487-4ca02e191efc","resolution":{"observed_at":"2026-08-02T13:36:53.993819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-01T15:36:22.838882Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26451","last_updated":"2026-07-29T04:04:54Z","snapshot_observed_at":"2026-08-03T18:40:07.560051Z","submitted_at":"2026-07-29T04:04:54Z","title":"ExplainBench: Evaluating Code Explanations from Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T15:36:22.838882Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.26451"},"observation_digest":"sha256:65f4ea3fb06cbf9e7ffb9eb4510028b8c30b26721c21d4de4514bf22e6e893d7","observation_id":"badf8a55-2f7c-42ca-ad32-774b65927750","resolution":{"observed_at":"2026-08-01T15:36:22.838882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.11939/citation-record","integrity":"/paper/2406.11939/integrity","json":"/paper/2406.11939/citation-record.json","paper":"/paper/2406.11939"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":"2403.17297","doi":"10.48550/arxiv.2403.17297","metadata_source":"pith","pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternLM2 Technical Report","venue":"cs.CL","work_id":"dfa13e0e-1c3c-4fb6-943d-a19945bacdbe","year":2024},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:c031c033bc42fc208a4c00e126c45f7cfbb9f48e512e043fe026c331de9d1c4e","observation_id":"95df49c6-7ed0-4fd1-8578-c9df2887dc29","resolution":{"observed_at":"2026-05-24T00:03:38.978285Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:c11950bbd543aa010c259639f3c4a646eabb161dc6e80fc0b75600744391235f","observation_id":"ca8c94d0-bb92-4d0e-ba17-fd0a9cad37e2","resolution":{"observed_at":"2026-05-24T00:03:38.982197Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e5e12ba9-0c61-4ae7-91fc-27c6460b044c","year":null},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T23:59:46.467362Z"},"links":{"citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:12b17f63dda1f6426b21da30bc4716640ee793f30fe153c2b3c851302af883c0","observation_id":"bbb83d99-d44f-4eaa-b5e9-aa62b71fadc0","resolution":{"observed_at":"2026-05-24T00:58:42.137116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"07b98e6e-a795-4958-9231-b204723fe9cf","year":null},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T23:59:46.467362Z"},"links":{"citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:4e193fa555c858f05c7d7cd0854a223e4a65872f59277ecce6c940a18088d275","observation_id":"91627f94-15f5-4c9a-8d42-17858dd5fa38","resolution":{"observed_at":"2026-05-24T00:58:42.097331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"75a27d30-4683-46aa-9b92-c83e1cc078e7","year":null},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T23:59:46.467362Z"},"links":{"citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:4f58918ae4724f5cce7d8ad7539e21fe9262c7bfa53344039594cd57efcfcf76","observation_id":"b811a5f6-6b23-40ed-bde8-474e447f6844","resolution":{"observed_at":"2026-05-24T00:58:42.143797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f55f842a-babe-4a56-9b32-f35ea34829af","year":null},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T23:59:46.467362Z"},"links":{"citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:13133cbf13ad2f9670b399ce7c06728555b89802bf8d85f0d0d7b15713d1be82","observation_id":"a2150172-ad39-4717-bbd2-7c697f03238d","resolution":{"observed_at":"2026-05-24T00:58:42.100273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"829f225c-94f1-4f77-9b76-90f945b60b20","year":null},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T23:59:46.467362Z"},"links":{"citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:a2bc7b30a6045dd49274ab6c79183c8c44cf878bf0ea1e036db67612f194de1f","observation_id":"f5fa58e5-0868-4f1c-b0a7-2891005932ee","resolution":{"observed_at":"2026-05-24T00:58:42.140443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d216e8ba-8273-45a8-8bb7-a9333da5bf5f","year":null},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T23:59:46.467362Z"},"links":{"citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:a6d7580f7d0f2b759aebf5977c26b1dea1cba34539724d7b620bc1bf56a65056","observation_id":"cca12022-6220-4a7f-b922-115b0fd342ab","resolution":{"observed_at":"2026-05-24T00:58:42.147138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Criteria Satisfied: [1, 2, 4, 6, 7]","venue":null,"work_id":"7af45f58-a767-4656-beb9-ba4b399818b5","year":null},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T23:59:46.467362Z"},"links":{"citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:7681f07556fbf8e289928434aff285535ac76f166cf37bec80496ff1319c1323","observation_id":"5de70c9c-91f2-4cb6-a749-d7955c607bc8","resolution":{"observed_at":"2026-05-24T00:58:42.133553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"12b604ed-fff4-49d1-ad5d-1fdfc415151f","year":null},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T23:59:46.467362Z"},"links":{"citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:dcf1fd5066f788a3d8e31de4597b75ae39def0e1172205de6742aac860de482c","observation_id":"187cc44f-b6e0-4718-842a-82fff15b785e","resolution":{"observed_at":"2026-05-24T00:58:42.155492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d5b1ba16-21c1-4684-a5ae-552d59ca6e38","year":null},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T23:59:46.467362Z"},"links":{"citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:6ef2326e94ce6ca3c3e2548ed13bdda28da28c495fd0cb638284f86401581f60","observation_id":"361fe78c-86c9-4022-b54b-6ba9c95cd031","resolution":{"observed_at":"2026-05-24T00:58:42.151249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e2bc19eb-7754-4218-8614-ab7fa2de475f","year":null},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T23:59:46.467362Z"},"links":{"citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:2d7b06a47fd1a2ff72d8cf5ca99f19db0bc81c9fa4e3b36acf8bbbb5c2c07196","observation_id":"b7a2aa7f-e2c0-4835-a245-390962c2382b","resolution":{"observed_at":"2026-05-24T00:58:42.129844Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cef202d2-afc0-4bff-b1fb-f91857958dd1","year":null},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T23:59:46.467362Z"},"links":{"citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:7bf68bd8010a05d28fb4a0c6cd32817e99f3f6f3650d47b82f459017ebb26582","observation_id":"a3412354-876c-43bf-9da8-efd5f3ae23c5","resolution":{"observed_at":"2026-05-24T00:58:42.120990Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"My final verdict is tie: [[A=B]]","venue":null,"work_id":"5281cbcc-39fb-4add-8e0b-8cdc794e6042","year":null},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T23:59:46.467362Z"},"links":{"citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:4af6d0610bc3b8d3fdbc1363bb5248325aec01d3fad0b2089a56702dc429b410","observation_id":"a97f0125-6542-40cb-b5d6-0747d397d2e0","resolution":{"observed_at":"2026-05-24T00:58:42.125529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 59 inbound Pith citation observations for arXiv:2406.11939."}