Pith. sign in

Paper Citation Record · LEDGER

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents

As of 4 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2607.06008.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.06008 v2

Coverage vector

measured 20 of 20 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-11T11:50:26.030339Z

measured 20 of 20 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-03T06:30:56.289259+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

20 of 20 outbound references displayed

  • verified exact9
  • verified fuzzy9
  • unresolved0
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation ba6f5ccb-7b29-4481-aebd-b213a5031950 · outbound

This paper cites Mle-bench: Evaluating machine learning agents on machine learning engineering.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Mle-bench: Evaluating machine learning agents on machine learning engineering

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-07-11T01:37:43.926007Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:aeda0afed7f872174559c86e2299f28f8dc7c792d834f60e5132c67248aa8697

Observation 9cadee4b-edbb-4b17-9701-12f9ce70257e · outbound

This paper cites WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-11T01:37:42.526508Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:97b2dae39816496836be6d1bc091fae48ecafb28700760127f6fd24102b0c151

Observation 0dab83c0-d197-4afe-b396-dfe62bb4f293 · outbound

This paper cites RAGBench: Explainable Benchmark for Retrieval-Augmented Generation Systems.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents RAGBench: Explainable Benchmark for Retrieval-Augmented Generation Systems

Reference 3

Resolution
metadata mismatch
local_arxiv, observed 2026-07-11T01:37:42.793879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:01b58a5f67e8068f6ca8d2a29cada01c7e0940fc45af5146f1533827fa63f2d7

Observation ca1e77b6-5512-4903-95dd-b814270c0cf5 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Measuring Massive Multitask Language Understanding

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-07-11T01:37:42.691850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T01:08:06.256034+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:ff1d46d6a41787dede44e84e739d45e2099167a6c8e506796a6ee07998951268

Observation 0d3b979c-dc46-4c93-8180-60abeb157686 · outbound

This paper cites Maps: A multilingual benchmark for agent performance and security.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Maps: A multilingual benchmark for agent performance and security

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-07-11T01:37:44.079838Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:91bdc59f96faa9123abdb8f6ee9319fe55fff5a2ad9fe2967122b65f1a73d268

Observation 77e47f8a-b7d3-4513-a9bd-9127697abfd5 · outbound

This paper cites Swe-bench: Can language models resolve real-world github issues? InInternational Conference on Learning Representations, volume 2024, pages 54107–54157,.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Swe-bench: Can language models resolve real-world github issues? InInternational Conference on Learning Representations, volume 2024, pages 54107–54157,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-07-11T01:37:44.041708Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:1bc03f1f682fef8f69f9a2d809740c568228bbace56df0dcba2bc5596bfdea81

Observation 0f85dd62-8a26-47f3-bc12-5ac9d935ec30 · outbound

This paper cites Okapi: Instruction-tuned large language models in multiple languages with reinforcement learning from human feedback.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Okapi: Instruction-tuned large language models in multiple languages with reinforcement learning from human feedback

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-07-11T01:37:44.152353Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:0bf0cdb9cc5514857398509c27875c4470c041d094b145130bd679412e2a192e

Observation 71407461-773a-4b33-add0-da937d2de379 · outbound

This paper cites Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

Reference 8

Resolution
malformed identifier
local_arxiv, observed 2026-07-11T01:37:41.892647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T11:50:26.030339Z digest=sha256:2d1eaca1ce99cafc72a2646dca68598b8a5de4acc9850e9a53bb7e1bab496361

Observation c58c1416-b373-45ee-82f0-70fd990fc1fa · outbound

This paper cites Xglue: A new benchmark dataset for cross-lingual pre-training, understanding and generation.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Xglue: A new benchmark dataset for cross-lingual pre-training, understanding and generation

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-07-11T01:37:43.998716Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:328169fcd00496197d6be243b76697b61569e83d5ce73160579ada634b93cd69

Observation b05fc453-493b-4738-8cfc-449cbc814a46 · outbound

This paper cites Agentbench: Evaluating llms as agents.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Agentbench: Evaluating llms as agents

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-07-11T01:37:44.073549Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:230489aef969a90f8a8098b70cdbf4c004b021842cf49d40f5f2193c680ace91

Observation b3611f80-5451-40c1-96e3-10bec46c0c40 · outbound

This paper cites ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-07-11T01:37:42.757410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:d05db9dd15c8b3d5213aa4656c2bd8850c20618be30afe00be65ee558396ce81

Observation e42fabf6-20f8-4ef8-8515-51907686bed7 · outbound

This paper cites Gaia: a benchmark for general ai assistants.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Gaia: a benchmark for general ai assistants

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-07-11T01:37:43.962826Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:4c488daeeb98ce34cde4690fa6bf3a6b794564be3997382c7f13eb04665c1a42

Observation 59d84f9f-5299-44ed-8dbb-bcf40d61c9ee · outbound

This paper cites Language Models are Multilingual Chain-of-Thought Reasoners.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Language Models are Multilingual Chain-of-Thought Reasoners

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-07-11T01:37:42.719012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:9a1be0803208acf7da7f258a1bdfc5f641f04c3aece7508f4b844133e34fe49f

Observation f27d869b-e975-4c8d-93d0-e06cd117d0da · outbound

This paper cites Coffeebench: Benchmarking long-horizon llm agents in heterogeneous multi-agent economies.arXiv preprint arXiv:2606.16613,.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Coffeebench: Benchmarking long-horizon llm agents in heterogeneous multi-agent economies.arXiv preprint arXiv:2606.16613,

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-07-11T01:37:42.684198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:0e9c1f49f0a9eb5fb8731241981b4e68daf452e14bf310515e1f54a71268c428

Observation f397c96c-d193-4806-aac6-ff5a0bebca5a · outbound

This paper cites Mirage-bench: Automatic multilingual benchmark arena for retrieval-augmented generation systems.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Mirage-bench: Automatic multilingual benchmark arena for retrieval-augmented generation systems

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-07-11T01:37:44.190151Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:7d216ea2aac5ae7214d3624a548612effc3172a6c480e2e662846502f8bb6717

Observation 3d6e37f4-3f48-4ee5-9232-60d5934d89f5 · outbound

This paper cites OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-07-11T01:37:42.831140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:88c309a3adabd66b40f736dde5ee1e7397039004dcca2f0a53b36f596ffd9869

Observation ac55d9ce-f3a7-4083-b841-78885a022dff · outbound

This paper cites OfficeBench: Benchmarking Language Agents across Multiple Applications for Office Automation.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents OfficeBench: Benchmarking Language Agents across Multiple Applications for Office Automation

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-07-11T01:37:42.726491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:924b652aeccf83123bc65f17ea64a4abb51fbefd225db5f64c526253d5b658c7

Observation ccd35c02-7096-43ef-8624-5d94d1e5a477 · outbound

This paper cites $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-07-11T01:37:42.761019Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:e353dd814adfba72754ef1f03ec321ed428abd97c95111616a712d25f5bef30f

Observation 4144ca50-3033-4005-831b-e75ca6ee40f0 · outbound

This paper cites Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-07-11T01:37:42.627081Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:80751bf29cf519b6dbaf4f3de2717d2269ba5083c3869dba1c8b1763935c8e11

Observation 76d7ff12-5a3a-43aa-883a-6144cc88164d · outbound

This paper cites Webarena: A realistic web environment for building autonomous agents.

PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents Webarena: A realistic web environment for building autonomous agents

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-07-11T01:37:44.117426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-07-11T01:37:23.646537Z digest=sha256:dd7f823943f9bb7b39ce6c82e41f714cf303a877832f92bd24d6623b89f9c27f

Pith citing papers

No inbound Pith citation observations are available.