{"as_of":"2026-08-04T07:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a50d712bbeba52db1069f2f5893767e062b1aff0c009931d72a807c9e6812f8c","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06008/citation-record","integrity":"/paper/2607.06008/integrity","json":"/paper/2607.06008/citation-record.json","paper":"/paper/2607.06008"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:37:43.893075Z","title":"Mle-bench: Evaluating machine learning agents on machine learning engineering","venue":null,"work_id":"4ccbefaa-b8be-4f77-abeb-4e42fbb010d1","year":2025},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:2488c62a2647e9638aa686d6d92df7a92d5a19792871ea0e58d04c814045f489","observation_id":"ba6f5ccb-7b29-4481-aebd-b213a5031950","resolution":{"observed_at":"2026-07-11T01:37:43.926007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10912","last_updated":"2026-05-11T17:49:43Z","snapshot_observed_at":"2026-08-03T00:15:01.823825Z","submitted_at":"2026-05-11T17:49:43Z","title":"WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation","version":1},"cited_work":{"arxiv_id":"2605.10912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.10912","snapshot_observed_at":"2026-07-11T01:37:42.499659Z","title":"WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation","venue":"cs.CL","work_id":"070744ec-8dfb-4b87-96fe-d67e9e2114e8","year":2026},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"cited_paper":"/paper/2605.10912","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:b6155cca031f391ffe69aca3862a5da82b71f0f0719842eac7bb61f022b8dc5b","observation_id":"9cadee4b-edbb-4b17-9701-12f9ce70257e","resolution":{"observed_at":"2026-07-11T01:37:42.526508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11005","last_updated":"2025-01-16T10:05:17Z","snapshot_observed_at":"2026-08-02T04:19:26.632510Z","submitted_at":"2024-06-25T20:23:15Z","title":"RAGBench: Explainable Benchmark for Retrieval-Augmented Generation Systems","version":2},"cited_work":{"arxiv_id":"2407.11005","doi":"10.48550/arxiv.2407.11005","metadata_source":"pith","pith_arxiv_id":"2407.11005","snapshot_observed_at":"2026-07-11T01:37:42.765684Z","title":"Ruiliu Fu, Han Wang, Xuejun Zhang, Jun Zhou, and Yonghong Yan","venue":"cs.CL","work_id":"1af2b2a4-5234-40d9-97b9-96893a44c7bf","year":2024},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"cited_paper":"/paper/2407.11005","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:be25f04959e001db2bc58a3f9730673995169abb07b55913fa16e8c2460e4c63","observation_id":"0dab83c0-d197-4afe-b396-dfe62bb4f293","resolution":{"observed_at":"2026-07-11T01:37:42.793879Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-15T19:20:23.442893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T19:20:23.442893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:35064463a9b36f9cad60f2b99460a8cacf8f55f2544b5e1778d34331b51cdca2","observation_id":"ca1e77b6-5512-4903-95dd-b814270c0cf5","resolution":{"observed_at":"2026-07-11T01:37:42.691850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:37:44.046377Z","title":"Maps: A multilingual benchmark for agent performance and security","venue":null,"work_id":"d40f36f5-3105-40eb-96d5-ef3f5d3af6e0","year":2026},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:33649e101ba40d08c84fdd8a694bf6c734fb1779666c0cd9ec9fe094ecc64c9b","observation_id":"0d3b979c-dc46-4c93-8180-60abeb157686","resolution":{"observed_at":"2026-07-11T01:37:44.079838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:37:44.003063Z","title":"Swe-bench: Can language models resolve real-world github issues? InInternational Conference on Learning Representations, volume 2024, pages 54107–54157,","venue":null,"work_id":"c96507b1-a594-45cf-b315-4c426579199f","year":2024},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:ccb2032a515e04d8fafda7099b8d606b29bb9f27aa1ed1fad0019d8a4b324d87","observation_id":"77e47f8a-b7d3-4513-a9bd-9127697abfd5","resolution":{"observed_at":"2026-07-11T01:37:44.041708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:37:44.121718Z","title":"Okapi: Instruction-tuned large language models in multiple languages with reinforcement learning from human feedback","venue":null,"work_id":"75664249-209f-4fd7-bb35-fc5e04a16d03","year":2023},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:cd354b503ef2b14c32029146f8c85398af129c3fe5964acbd81e67160c4e5aa5","observation_id":"0f85dd62-8a26-47f3-bc12-5ac9d935ec30","resolution":{"observed_at":"2026-07-11T01:37:44.152353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.28139","last_updated":"2026-05-01T09:39:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T17:23:19Z","title":"Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows","version":2},"cited_work":{"arxiv_id":"2604.28139","doi":"10.18653/v1/2023.emnlp-demo.28.https://aclanthology.org/2023.emnlp-demo.28/","metadata_source":"pith","pith_arxiv_id":"2604.28139","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows","venue":"cs.SE","work_id":"519230b1-eb35-4f2c-a0ed-824ba45c6abd","year":2026},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2604.28139","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:6c56c5242078b05b10b6f3e6487b22272697f39ecc1bc8d71b8d2f35a2013a86","observation_id":"71407461-773a-4b33-add0-da937d2de379","resolution":{"observed_at":"2026-07-11T01:37:41.892647Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:37:43.968490Z","title":"Xglue: A new benchmark dataset for cross-lingual pre-training, understanding and generation","venue":null,"work_id":"3fdfc99d-cdc0-4b71-992b-bb23ef90d8b8","year":2020},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:9b32c0378c9a57955dbc308b1265c1d0a8a9710403086c978436f1742a7cfb4c","observation_id":"c58c1416-b373-45ee-82f0-70fd990fc1fa","resolution":{"observed_at":"2026-07-11T01:37:43.998716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:37:44.041745Z","title":"Agentbench: Evaluating llms as agents","venue":null,"work_id":"b0ce6e82-0d7a-470b-a1f6-e4a7df584abd","year":2024},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:52a3484e6b10dc5da6c93174e6e2f58e5e1c2261d632687da622159661ddbf18","observation_id":"b05fc453-493b-4738-8cfc-449cbc814a46","resolution":{"observed_at":"2026-07-11T01:37:44.073549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23781","last_updated":"2026-05-05T15:32:46Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T16:05:02Z","title":"ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents","version":2},"cited_work":{"arxiv_id":"2604.23781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.23781","snapshot_observed_at":"2026-07-11T01:37:42.725645Z","title":"ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents","venue":"cs.CV","work_id":"d318932b-5733-4526-a467-d57db0337db5","year":2026},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"cited_paper":"/paper/2604.23781","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:768056165a2b400ef8ce636ab92f3ebb5ba4e7905d012ecb79ac9d29155c9b56","observation_id":"b3611f80-5451-40c1-96e3-10bec46c0c40","resolution":{"observed_at":"2026-07-11T01:37:42.757410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:37:43.933230Z","title":"Gaia: a benchmark for general ai assistants","venue":null,"work_id":"e9da6cee-b433-4aee-9e56-185f33d4dbf7","year":2024},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:bff3f5f1af22c7bdb85329ad2705e484ee3c9a5e7228484b7ea025a500efff2a","observation_id":"e42fabf6-20f8-4ef8-8515-51907686bed7","resolution":{"observed_at":"2026-07-11T01:37:43.962826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03057","last_updated":"2022-10-06T17:03:34Z","snapshot_observed_at":"2026-07-06T14:00:37.875054Z","submitted_at":"2022-10-06T17:03:34Z","title":"Language Models are Multilingual Chain-of-Thought Reasoners","version":1},"cited_work":{"arxiv_id":"2210.03057","doi":"10.48550/arxiv.2210.03057","metadata_source":"pith","pith_arxiv_id":"2210.03057","snapshot_observed_at":"2026-07-11T01:37:42.691693Z","title":"Language Models are Multilingual Chain-of-Thought Reasoners","venue":"cs.CL","work_id":"1534249c-ff7a-417c-9fb7-7505743d1c20","year":2022},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"cited_paper":"/paper/2210.03057","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:7fe60f233bb3b32231885ef33ec6b7d61bb331e0ae418573747e8713e99cf11b","observation_id":"59d84f9f-5299-44ed-8dbb-bcf40d61c9ee","resolution":{"observed_at":"2026-07-11T01:37:42.719012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.16613","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:37:42.653140Z","title":"Coffeebench: Benchmarking long-horizon llm agents in heterogeneous multi-agent economies.arXiv preprint arXiv:2606.16613,","venue":null,"work_id":"753f8028-0d95-493e-9813-e7b42ba27cb4","year":null},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:a458a413e7cfd27d3306a3723e2885a9e8faa26822a3d96b070d0328f4dfc67e","observation_id":"f27d869b-e975-4c8d-93d0-e06cd117d0da","resolution":{"observed_at":"2026-07-11T01:37:42.684198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:37:44.156797Z","title":"Mirage-bench: Automatic multilingual benchmark arena for retrieval-augmented generation systems","venue":null,"work_id":"494ebf9c-c85c-4e67-a2f0-01ae70f5aed5","year":2025},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:81d24e991a3249917d54e3d4e00572448481cdb16cd82f8c7f20d1abe395287d","observation_id":"f397c96c-d193-4806-aac6-ff5a0bebca5a","resolution":{"observed_at":"2026-07-11T01:37:44.190151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:68202b0787ecc47936d001ea33aa3c526cdd27885161bc228f482d447f3acedd","observation_id":"3d6e37f4-3f48-4ee5-9232-60d5934d89f5","resolution":{"observed_at":"2026-07-11T01:37:42.831140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19056","last_updated":"2024-07-26T19:27:17Z","snapshot_observed_at":"2026-08-03T10:35:13.470915Z","submitted_at":"2024-07-26T19:27:17Z","title":"OfficeBench: Benchmarking Language Agents across Multiple Applications for Office Automation","version":1},"cited_work":{"arxiv_id":"2407.19056","doi":"10.48550/arxiv.2407.19056","metadata_source":"pith","pith_arxiv_id":"2407.19056","snapshot_observed_at":"2026-07-11T01:37:42.698636Z","title":"Officebench: Benchmarking language agents across multiple applications for office automation","venue":"cs.CL","work_id":"1f4b598a-160f-4513-9b90-2233578e53a0","year":2024},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"cited_paper":"/paper/2407.19056","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:a6113fae83f350666d26e451357c169f0209b10faf437b3c11d2e1350f02c758","observation_id":"ac55d9ce-f3a7-4083-b841-78885a022dff","resolution":{"observed_at":"2026-07-11T01:37:42.726491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-02T22:19:29.043854Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":"2406.12045","doi":"10.48550/arxiv.2406.12045","metadata_source":"pith","pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-07-11T01:37:42.734447Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","venue":"cs.AI","work_id":"6a8d8dc4-0cc0-4052-8109-abbcdcd4a962","year":2024},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:d87713054f2d31896fbf2d3132e02cbf9de696b8a96bcadfa79f5cba03334238","observation_id":"ccd35c02-7096-43ef-8624-5d94d1e5a477","resolution":{"observed_at":"2026-07-11T01:37:42.761019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06132","last_updated":"2026-05-07T14:06:23Z","snapshot_observed_at":"2026-07-06T22:54:40.349479Z","submitted_at":"2026-04-07T17:43:18Z","title":"Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents","version":3},"cited_work":{"arxiv_id":"2604.06132","doi":"10.48550/arxiv.2604.06132","metadata_source":"pith","pith_arxiv_id":"2604.06132","snapshot_observed_at":"2026-07-11T01:37:42.602509Z","title":"Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents","venue":"cs.AI","work_id":"57acc3ec-f4c3-49ab-bd0f-5aab91002df9","year":2026},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"cited_paper":"/paper/2604.06132","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:ddd26ec721157c6428b8b1dc2b0d5f91f2263f73db6cd9fb8be25c0543007c2c","observation_id":"4144ca50-3033-4005-831b-e75ca6ee40f0","resolution":{"observed_at":"2026-07-11T01:37:42.627081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:37:44.084508Z","title":"Webarena: A realistic web environment for building autonomous agents","venue":null,"work_id":"da7312ab-b997-4fb5-8005-355f7ce763ca","year":2024},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:d5dca0cd7e132af60d19bbff70e0a9543395923acd9d5fbc340190e9a09ae660","observation_id":"76d7ff12-5a3a-43aa-883a-6144cc88164d","resolution":{"observed_at":"2026-07-11T01:37:44.117426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":9},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2607.06008."}