{"as_of":"2026-08-07T10:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59979852f01b83346e46c40928bfe698a921b550f305c4251a8c07d9e3d7d593","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:02:41.100115Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22853/citation-record","integrity":"/paper/2506.22853/integrity","json":"/paper/2506.22853/citation-record.json","paper":"/paper/2506.22853"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.00121","last_updated":"2024-06-27T17:47:26Z","snapshot_observed_at":"2026-07-06T18:38:42.333605Z","submitted_at":"2024-06-27T17:47:26Z","title":"Granite-Function Calling Model: Introducing Function Calling Abilities via Multi-task Learning of Granular Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00121","snapshot_observed_at":"2026-08-06T22:02:37.650566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:37.650566Z"},"links":{"cited_paper":"/paper/2407.00121","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:8ae03a4609e2ac25674412427d06fd9d74c75ef11651a3d1bd3ba932273bc699","observation_id":"67af86c5-852a-4eab-9f36-fc04dcc5593f","resolution":{"observed_at":"2026-08-06T22:02:37.650566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-06T22:02:37.731201Z","title":"Hewett, Mojan Javaheripi, Piero Kauffmann, James R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:37.731201Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:1618f72dff44ae361808cd5b1808a3804c21b4fd551940a69c9ecbaa0255b692","observation_id":"fb98c640-b9ef-4d10-b882-d412b61048b5","resolution":{"observed_at":"2026-08-06T22:02:37.731201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08820","last_updated":"2025-02-19T04:28:49Z","snapshot_observed_at":"2026-08-03T10:34:14.947858Z","submitted_at":"2025-02-12T22:18:34Z","title":"Can a Single Model Master Both Multi-turn Conversations and Tool Use? CoALM: A Unified Conversational Agentic Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08820","snapshot_observed_at":"2026-08-06T22:02:37.849489Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:37.849489Z"},"links":{"cited_paper":"/paper/2502.08820","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:01b933e9a06cd4b75fea29483e2a754448adf7aa04b473bb13c66bdad8376c78","observation_id":"1263e47b-b410-4cc9-862a-b4c46cd4ebdd","resolution":{"observed_at":"2026-08-06T22:02:37.849489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15491","last_updated":"2024-05-20T14:52:31Z","snapshot_observed_at":"2026-07-06T17:34:40.933767Z","submitted_at":"2024-02-23T18:30:49Z","title":"API-BLEND: A Comprehensive Corpora for Training and Benchmarking API LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15491","snapshot_observed_at":"2026-08-06T22:02:37.949602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:37.949602Z"},"links":{"cited_paper":"/paper/2402.15491","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:3be43100cd8c67f293159803a3153e216809d646dcacd14c15cdfd69af1b2baf","observation_id":"ace2d624-af41-4043-99fc-7f8c256c5689","resolution":{"observed_at":"2026-08-06T22:02:37.949602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:45.168250Z","title":null,"venue":null,"work_id":"2a0ae983-129c-4d69-b7ca-9dbddcca97f9","year":2011},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.066276Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:0844b4c853a9304a3ed0ff007bf4d27a57ea2e16f09257f703faa41fc24a5574","observation_id":"07f59721-6407-409e-955d-616765d4661a","resolution":{"observed_at":"2026-08-06T22:02:45.244990Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09020","last_updated":"2019-04-18T21:33:15Z","snapshot_observed_at":"2026-08-06T00:55:15.181542Z","submitted_at":"2019-04-18T21:33:15Z","title":"Genie: A Generator of Natural Language Semantic Parsers for Virtual Assistant Commands","version":1},"cited_work":{"arxiv_id":"1904.09020","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09020","snapshot_observed_at":"2026-08-06T22:02:43.004938Z","title":"Genie: A Generator of Natural Language Semantic Parsers for Virtual Assistant Commands","venue":"cs.CL","work_id":"695fd097-f784-487f-b79e-43e412561677","year":2019},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.215072Z"},"links":{"cited_paper":"/paper/1904.09020","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:1877d90e4c2e600b6383bddb014c5783ad5417e22b463be8be205ac3ab767edb","observation_id":"ee157638-d7a2-4999-a40a-7d55726c6ca0","resolution":{"observed_at":"2026-08-06T22:02:43.088698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14033","last_updated":"2024-01-15T03:18:25Z","snapshot_observed_at":"2026-07-06T17:06:37.369542Z","submitted_at":"2023-12-21T17:02:06Z","title":"T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14033","snapshot_observed_at":"2026-08-06T22:02:38.371492Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.371492Z"},"links":{"cited_paper":"/paper/2312.14033","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:bcb8e6e76a1c9cc5e62376374b2217ef10f7fa52cdfcda72626b71268d0b3df4","observation_id":"6512ffbd-b7dd-481e-88e9-49d88c10eb49","resolution":{"observed_at":"2026-08-06T22:02:38.371492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00608","last_updated":"2024-10-25T01:16:55Z","snapshot_observed_at":"2026-07-06T19:08:48.648862Z","submitted_at":"2024-09-01T04:23:48Z","title":"TinyAgent: Function Calling at the Edge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00608","snapshot_observed_at":"2026-08-06T22:02:38.481560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.481560Z"},"links":{"cited_paper":"/paper/2409.00608","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:55f1e819d89dc6f43d02657033db4c5589fe43e42f717af747692b943148ed75","observation_id":"eaa1891e-46d6-412f-9683-9fdaeac463ce","resolution":{"observed_at":"2026-08-06T22:02:38.481560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10775","last_updated":"2023-11-15T23:50:31Z","snapshot_observed_at":"2026-07-06T16:49:13.099946Z","submitted_at":"2023-11-15T23:50:31Z","title":"ToolTalk: Evaluating Tool-Usage in a Conversational Setting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10775","snapshot_observed_at":"2026-08-06T22:02:38.534202Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.534202Z"},"links":{"cited_paper":"/paper/2311.10775","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:c6581ae7a64b44a2d69e1fa75db774b15394d24a89f86e999c535068df12b04c","observation_id":"b7820be4-1746-493c-bf47-d3385e69a83e","resolution":{"observed_at":"2026-08-06T22:02:38.534202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-06T22:02:38.574014Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.574014Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:8d65c16672ccf9489c5652989462238df708cf462a4795cff276448207869247","observation_id":"f8a22051-a2c3-4fc7-9b9b-e797ebfe2b16","resolution":{"observed_at":"2026-08-06T22:02:38.574014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00402","last_updated":"2025-07-06T08:13:18Z","snapshot_observed_at":"2026-07-31T17:16:16.006644Z","submitted_at":"2024-06-29T11:09:47Z","title":"Is It Really Long Context if All You Need Is Retrieval? Towards Genuinely Difficult Long Context NLP","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00402","snapshot_observed_at":"2026-08-06T22:02:38.627939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.627939Z"},"links":{"cited_paper":"/paper/2407.00402","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:9e649ce9395154d7599a42b8073377f58058c3a3bf8f4627ab84a9f62f0a975a","observation_id":"f7cbef17-dec1-4b55-b70c-7db2756b1bc5","resolution":{"observed_at":"2026-08-06T22:02:38.627939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06360","last_updated":"2024-02-09T12:10:00Z","snapshot_observed_at":"2026-08-07T09:27:01.218510Z","submitted_at":"2024-02-09T12:10:00Z","title":"CoSearchAgent: A Lightweight Collaborative Search Agent with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06360","snapshot_observed_at":"2026-08-06T22:02:38.725718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.725718Z"},"links":{"cited_paper":"/paper/2402.06360","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:0eeb73bd9499957914fab265987bce67ea06200909f991e11aba5956b5adc7b9","observation_id":"140e6b49-c3e1-4f90-99d9-53875517b35e","resolution":{"observed_at":"2026-08-06T22:02:38.725718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06677","last_updated":"2023-12-04T07:51:58Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-04T07:51:58Z","title":"Intelligent Virtual Assistants with LLM-based Process Automation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06677","snapshot_observed_at":"2026-08-06T22:02:38.797381Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.797381Z"},"links":{"cited_paper":"/paper/2312.06677","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:3aeb801504105209ac24943ded99eecd07b7a6d0cb6a0a8f846749cd2e91840a","observation_id":"64c732c0-1389-4afa-8e90-b22d0b70dc3b","resolution":{"observed_at":"2026-08-06T22:02:38.797381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-06T22:02:38.861022Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.861022Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:5eeb6222e897e85fdd2b5b972078dfdb884766a92abfc20e112e902341e9d375","observation_id":"20756517-6596-4bec-9837-d139ff5bdd0b","resolution":{"observed_at":"2026-08-06T22:02:38.861022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16643","last_updated":"2025-03-18T06:39:36Z","snapshot_observed_at":"2026-08-06T07:52:37.006863Z","submitted_at":"2025-01-28T02:27:55Z","title":"An LLM Benchmark for Addressee Recognition in Multi-modal Multi-party Dialogue","version":2},"cited_work":{"arxiv_id":"2501.16643","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.16643","snapshot_observed_at":"2026-08-06T22:02:42.559862Z","title":"An LLM Benchmark for Addressee Recognition in Multi-modal Multi-party Dialogue","venue":"cs.CL","work_id":"0ca8f355-1e66-41c1-af71-020c8e47b5f3","year":2025},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.931012Z"},"links":{"cited_paper":"/paper/2501.16643","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:ac35145b74b1bc6b6a523f3a7330042cf731a6bc2e8d2a11f3a3c4e8bd39a990","observation_id":"17b10d36-0521-4cdb-9bc0-99c1e690b5a6","resolution":{"observed_at":"2026-08-06T22:02:42.730281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T22:02:38.975216Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.975216Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:499f5862ba95235683a889df789fd7c04fd9ce4432534b23ddbe29031047f256","observation_id":"1890a7c7-d408-4896-9b3f-b6f43833978d","resolution":{"observed_at":"2026-08-06T22:02:38.975216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:44.982510Z","title":null,"venue":null,"work_id":"6b0fcb03-907a-44dc-a0eb-189d948ced16","year":2019},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.071046Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:87493e16ca864a8ee693db8877a1df8876f77bc293272216906360106a3d04a9","observation_id":"9920ca20-b5c2-400f-a140-a0c3904cd7f0","resolution":{"observed_at":"2026-08-06T22:02:45.073905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08030","last_updated":"2024-02-12T19:49:58Z","snapshot_observed_at":"2026-07-06T17:29:08.902766Z","submitted_at":"2024-02-12T19:49:58Z","title":"Why and When LLM-Based Assistants Can Go Wrong: Investigating the Effectiveness of Prompt-Based Interactions for Software Help-Seeking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08030","snapshot_observed_at":"2026-08-06T22:02:39.143917Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.143917Z"},"links":{"cited_paper":"/paper/2402.08030","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:9200225e1635fa4da6bdb7ecc161747f8701478564b9c3a3abb3f428c1303035","observation_id":"abb7d8da-005f-4b43-89b6-c9ed2ea968b6","resolution":{"observed_at":"2026-08-06T22:02:39.143917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15523","last_updated":"2024-09-23T20:16:49Z","snapshot_observed_at":"2026-08-06T04:34:39.639678Z","submitted_at":"2024-09-23T20:16:49Z","title":"SEAL: Suite for Evaluating API-use of LLMs","version":1},"cited_work":{"arxiv_id":"2409.15523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15523","snapshot_observed_at":"2026-08-06T22:02:42.319476Z","title":"SEAL: Suite for Evaluating API-use of LLMs","venue":"cs.AI","work_id":"7e02d7b5-a3fd-4a84-b628-cbe24baa22ea","year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.212803Z"},"links":{"cited_paper":"/paper/2409.15523","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:2bce8ff2b26de642c11e204d2d0ef25cca88fba5c9f6f5ea9dac40d21e0625cc","observation_id":"cce720a0-115d-4a8e-88d7-e34a0c75fab4","resolution":{"observed_at":"2026-08-06T22:02:42.398827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16848","last_updated":"2025-02-27T08:15:49Z","snapshot_observed_at":"2026-07-06T19:37:42.469688Z","submitted_at":"2024-10-22T09:35:42Z","title":"ETHIC: Evaluating Large Language Models on Long-Context Tasks with High Information Coverage","version":2},"cited_work":{"arxiv_id":"2410.16848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.16848","snapshot_observed_at":"2026-08-06T22:02:42.098639Z","title":"ETHIC: Evaluating Large Language Models on Long-Context Tasks with High Information Coverage","venue":"cs.CL","work_id":"43a82d57-cd66-4a63-9401-5d0abdce6d09","year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.273106Z"},"links":{"cited_paper":"/paper/2410.16848","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:d9c34637ac16e4278c6552626c45d4d3337a3d43e62497efedb25219b023f5b4","observation_id":"6ac36575-d17c-4731-8683-e28c29e9355e","resolution":{"observed_at":"2026-08-06T22:02:42.211387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08244","last_updated":"2023-10-25T06:54:12Z","snapshot_observed_at":"2026-08-02T00:07:12.855748Z","submitted_at":"2023-04-14T14:05:32Z","title":"API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08244","snapshot_observed_at":"2026-08-06T22:02:39.336321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.336321Z"},"links":{"cited_paper":"/paper/2304.08244","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:803c44e14334e36800ee82a64f1cfe8791fd5eb2da13b18bdff8352b330f75ef","observation_id":"a4d59512-941d-4138-8afd-e64b0a39d3d4","resolution":{"observed_at":"2026-08-06T22:02:39.336321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00920","last_updated":"2025-07-25T08:26:54Z","snapshot_observed_at":"2026-08-07T03:58:38.931628Z","submitted_at":"2024-09-02T03:19:56Z","title":"ToolACE: Winning the Points of LLM Function Calling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00920","snapshot_observed_at":"2026-08-06T22:02:39.409173Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.409173Z"},"links":{"cited_paper":"/paper/2409.00920","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:6ae5bf1e10b62849d05bf34a2fba3189d14aa936c0252c6d86f4fe5e68a05496","observation_id":"2f8e3684-0fda-440d-884d-98e4ea610dc6","resolution":{"observed_at":"2026-08-06T22:02:39.409173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-06T22:02:39.463112Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.463112Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:b9c3ccb1f0c5f78cda7ab4dd3e6318e0b61f9507934beedd5ac7d96a8a004ccc","observation_id":"657ffe74-1b1a-4030-b055-d8fcbe58a610","resolution":{"observed_at":"2026-08-06T22:02:39.463112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:44.819510Z","title":"Manning and Hinrich Schütze","venue":null,"work_id":"a365f7d1-4d9e-419d-b445-4236a2e9a407","year":1999},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.552815Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:c01a90cf5057ae41632dc388d7f4cd98fcc7a79e87899dde946471589c3dd6dc","observation_id":"5a800961-81c6-4fc3-9866-d9d3e3ff30c3","resolution":{"observed_at":"2026-08-06T22:02:44.883790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:02:39.596859Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.596859Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:27579a3a0acd08598c8110a0bb9bb2eb95fdaa02cb57446cdf37eba9b5434893","observation_id":"f0c6393b-284a-4b21-9170-17b734c0e26e","resolution":{"observed_at":"2026-08-06T22:02:39.596859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:44.648114Z","title":"Bernstein","venue":null,"work_id":"2b8541ca-e7b7-4228-bcc4-14aed782e6c9","year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.688152Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:0a9b263532d83e3d67da804b828f30ff53157839ce3ace73c7cdd45a6dfd991a","observation_id":"2eaa2706-e189-4aef-9f14-8d5dd678067d","resolution":{"observed_at":"2026-08-06T22:02:44.719098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-06T22:02:39.734802Z","title":"Patil, Tianjun Zhang, Xin Wang, and Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.734802Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:41623e1ca1546704d873c19d7727c92e41d7918502ab5ff119c3afaa3ee191dd","observation_id":"ecc55d3b-2e3a-4235-9a5c-e8ae82c90c84","resolution":{"observed_at":"2026-08-06T22:02:39.734802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08354","last_updated":"2024-08-06T15:14:36Z","snapshot_observed_at":"2026-08-01T01:27:53.963888Z","submitted_at":"2023-04-17T15:16:10Z","title":"Tool Learning with Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08354","snapshot_observed_at":"2026-08-06T22:02:39.781162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.781162Z"},"links":{"cited_paper":"/paper/2304.08354","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:fbde207f9ce92d6ce3eb7900e1b7662c00afa64a10d3c508f3581da65adb5e29","observation_id":"966f52ad-265e-4f2f-9823-e73d8ad708d8","resolution":{"observed_at":"2026-08-06T22:02:39.781162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-06T22:02:39.832816Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.832816Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:e58b9d113475ef0d250b98869539313cd3d60d029bab33da1b45d6d6078e6f5f","observation_id":"d8eefb7e-6129-43c4-9966-2846c830af1d","resolution":{"observed_at":"2026-08-06T22:02:39.832816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17935","last_updated":"2024-11-04T15:07:18Z","snapshot_observed_at":"2026-08-05T15:30:21.695110Z","submitted_at":"2024-05-28T08:01:26Z","title":"Tool Learning with Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17935","snapshot_observed_at":"2026-08-06T22:02:39.878785Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.878785Z"},"links":{"cited_paper":"/paper/2405.17935","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:4a194d6690d16096a4184863d40fbf61067c506c5b7b54d7dd212c1e2b372f18","observation_id":"ebd8a6f6-34b6-4430-8e74-939421a62030","resolution":{"observed_at":"2026-08-06T22:02:39.878785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T22:02:39.913760Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.913760Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:1d997a2f23330e0a4dbc9edd0468f74464f8e78987ae63f73cf6fb1bdd7e8a16","observation_id":"32c161d1-5d57-4b99-b867-84df2740b0c3","resolution":{"observed_at":"2026-08-06T22:02:39.913760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:44.470392Z","title":null,"venue":null,"work_id":"a8030587-32a9-4133-ade5-77a3f0c0892f","year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.971592Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:396bfdd3c303ce94ebd9d2070e7a7ac01be70e16a54e3da0f5accbf05fb94aee","observation_id":"194f2059-bec4-4236-aa48-eaba2aac480e","resolution":{"observed_at":"2026-08-06T22:02:44.547233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:40.010427Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.010427Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:06fb95068efa30592763d168d366c6b1d549b21ecfe0578021cccfc135d32aa5","observation_id":"5ad492a3-1457-44b2-90e9-cdee7a3a7618","resolution":{"observed_at":"2026-08-06T22:02:40.010427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07956","last_updated":"2025-02-11T21:09:24Z","snapshot_observed_at":"2026-07-06T20:35:02.935416Z","submitted_at":"2025-02-11T21:09:24Z","title":"Bridging HCI and AI Research for the Evaluation of Conversational SE Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07956","snapshot_observed_at":"2026-08-06T22:02:40.051068Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.051068Z"},"links":{"cited_paper":"/paper/2502.07956","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:bda66102ca43b745b7dc0b80b459109ba0c849ccf91c11ccb6cfd5587a78e365","observation_id":"2fa50049-4b1e-41f4-801b-d5d2a67165f4","resolution":{"observed_at":"2026-08-06T22:02:40.051068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:44.301317Z","title":null,"venue":null,"work_id":"3dd5a575-a785-4f4b-bf3e-0ca4027a864e","year":1988},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.104042Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:1358b7def481fec1c75b9ae55ba6447232277f27eb46fcf0ba3a9ed952e51086","observation_id":"7584eeff-89c0-452b-a71c-7ac4129b577f","resolution":{"observed_at":"2026-08-06T22:02:44.405014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-06T22:02:40.144671Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.144671Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:93ece801a36298de1d424e238fefa00fe399be73a3f974ecaf67c294a3befafc","observation_id":"ddb17d27-535d-41e0-9462-2883dd5cd10f","resolution":{"observed_at":"2026-08-06T22:02:40.144671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:44.158667Z","title":null,"venue":null,"work_id":"4f9a880b-0012-465e-8caf-b77d17fc4d51","year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.206383Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:7e1be038e2923c158d6946dfbe1b568cb51a0ecdf5b657698f2d65e4b8a8b31a","observation_id":"598b52fb-ac15-4bd5-a9b2-6d0320e92621","resolution":{"observed_at":"2026-08-06T22:02:44.220824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-08-06T22:02:40.257193Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.257193Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:2c9edf92c6245ba19ae4909699ace344cc7bf91e4a26afeb85f2843b775804ba","observation_id":"ab839f1b-689b-47f7-a359-3fff8177c7b7","resolution":{"observed_at":"2026-08-06T22:02:40.257193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05301","last_updated":"2023-09-07T12:20:45Z","snapshot_observed_at":"2026-07-06T15:40:20.267344Z","submitted_at":"2023-06-08T15:46:32Z","title":"ToolAlpaca: Generalized Tool Learning for Language Models with 3000 Simulated Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05301","snapshot_observed_at":"2026-08-06T22:02:40.291583Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.291583Z"},"links":{"cited_paper":"/paper/2306.05301","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:ddf43c81da9ebe2ca10503abc6d922db0990eacf937d77eac2b3339b4c69f66f","observation_id":"da63ca7c-fa85-4fa8-903e-c1c44a098e9e","resolution":{"observed_at":"2026-08-06T22:02:40.291583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T22:02:40.342829Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.342829Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:b6969f45d218b9952c7eb4850df25e16f3a078bf59759c3f83f6e70e004bf78f","observation_id":"4c1a3027-16e2-4f09-8e63-345342b65479","resolution":{"observed_at":"2026-08-06T22:02:40.342829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:43.968243Z","title":null,"venue":null,"work_id":"596ace5e-5357-4754-ae26-d3a2e6ead742","year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.389822Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:59d5a6519ac8b9481f026a3df322e926055867bd274138d421453e75f38040ec","observation_id":"bfc23798-d9ac-4d89-8eed-a0dc20e9b9e5","resolution":{"observed_at":"2026-08-06T22:02:44.037471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T22:02:40.421187Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.421187Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:627873e72c20002467a59368600ae0f87e3bde14d6ffacb4499b2694fedb95fb","observation_id":"0c97b5fb-b823-42e4-a498-5d6d718bb907","resolution":{"observed_at":"2026-08-06T22:02:40.421187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14268","last_updated":"2024-08-14T00:48:43Z","snapshot_observed_at":"2026-08-05T14:37:26.019564Z","submitted_at":"2024-01-25T16:02:56Z","title":"GPTVoiceTasker: Advancing Multi-step Mobile Task Efficiency Through Dynamic Interface Exploration and Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14268","snapshot_observed_at":"2026-08-06T22:02:40.459154Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.459154Z"},"links":{"cited_paper":"/paper/2401.14268","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:1c517b8c0a5ccf3457c620dd2068e488322888b7a114465b0818ce656e3cd167","observation_id":"56f80d99-8a0d-437b-bc30-9babfb099cdb","resolution":{"observed_at":"2026-08-06T22:02:40.459154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:43.808989Z","title":null,"venue":null,"work_id":"9a078d25-cddf-4bf8-ab5b-52054db3601f","year":2010},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.521310Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:504923a5170576b78e7640824ba79f3e77c4d377d1b996d52568055faa6352d7","observation_id":"65dc56bb-2c0b-442d-b3db-66e711f76d3d","resolution":{"observed_at":"2026-08-06T22:02:43.889198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:43.656194Z","title":null,"venue":null,"work_id":"b47cc76b-2c23-4f6b-a00d-3130e5e1b2ca","year":1995},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.565257Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:58ad93a4866dbe1f904310bb325bc81b003fb347d65f8b75351ed4458542cd53","observation_id":"f8e6265f-9550-45e8-9f25-2c6b399afcd5","resolution":{"observed_at":"2026-08-06T22:02:43.705152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:40.606739Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.606739Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:0d5f7770c2f5edbae1183b78648fdd60cf88f710b6140d3f46f8016220403874","observation_id":"5909157e-e86c-44ea-9604-ca43eb156c05","resolution":{"observed_at":"2026-08-06T22:02:40.606739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11710","last_updated":"2024-10-15T15:46:17Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T15:46:17Z","title":"MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11710","snapshot_observed_at":"2026-08-06T22:02:40.651835Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.651835Z"},"links":{"cited_paper":"/paper/2410.11710","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:c8f3e9b24030f147967bf665f88cda3d2bff9cf5b72be3c18077f247fd635670","observation_id":"223e56c2-0253-48b2-8fd1-41e74a31a625","resolution":{"observed_at":"2026-08-06T22:02:40.651835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:43.518473Z","title":null,"venue":null,"work_id":"4c614866-e577-4d1d-a4b4-94a724bb4d2a","year":1966},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.699899Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:2e51c5b112061ee06a02943456d364b9211a8a7ce58623af262cdb0da3083214","observation_id":"97428b19-a228-4f2d-af5d-9c1cf2c353fc","resolution":{"observed_at":"2026-08-06T22:02:43.580860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16504","last_updated":"2023-05-25T22:10:20Z","snapshot_observed_at":"2026-08-06T09:13:52.781559Z","submitted_at":"2023-05-25T22:10:20Z","title":"On the Tool Manipulation Capability of Open-source Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16504","snapshot_observed_at":"2026-08-06T22:02:40.749933Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.749933Z"},"links":{"cited_paper":"/paper/2305.16504","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:70ec1ab93de791a2b5213fc1445c4d8611d25178f1efd2e67ace97594d46c1d6","observation_id":"5321c14a-8d40-4db5-a641-3352980a350c","resolution":{"observed_at":"2026-08-06T22:02:40.749933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00741","last_updated":"2024-12-05T07:05:59Z","snapshot_observed_at":"2026-08-02T12:30:41.516928Z","submitted_at":"2024-01-01T12:49:36Z","title":"ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00741","snapshot_observed_at":"2026-08-06T22:02:40.814433Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.814433Z"},"links":{"cited_paper":"/paper/2401.00741","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:66f8231a5c7a7761e168d48d18ea1caf7ddd5e3eb3e5ad4d4591d29319d55b84","observation_id":"aa42965a-feaf-4205-9eb2-6acc7788c794","resolution":{"observed_at":"2026-08-06T22:02:40.814433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08326","last_updated":"2024-09-21T08:03:33Z","snapshot_observed_at":"2026-07-06T17:16:08.962172Z","submitted_at":"2024-01-16T12:45:15Z","title":"RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning","version":3},"cited_work":{"arxiv_id":"2401.08326","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.08326","snapshot_observed_at":"2026-08-06T22:02:41.257812Z","title":"RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning","venue":"cs.CL","work_id":"62304fb1-3a11-4d2b-a49d-dd4918453a65","year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.848146Z"},"links":{"cited_paper":"/paper/2401.08326","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:6b06a01bf3b59c408e6d1086f07909755cd923d7838a25290c33d7a37d990ce5","observation_id":"14228d02-f6a2-4b96-bd90-60acba2b90c2","resolution":{"observed_at":"2026-08-06T22:02:41.368776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:43.341667Z","title":"Schweitzer, and Alison Wood Brooks","venue":null,"work_id":"c14f6f74-c0b4-48ca-871f-a9be491eb437","year":2022},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.893204Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:7d0ee0ce1a0ae5082b115a348b5a08036f4216522a0b584e85f5fb90ee3ec822","observation_id":"23c8b628-30fe-47e5-a5ad-8bcf7a1084c4","resolution":{"observed_at":"2026-08-06T22:02:43.458492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09959","last_updated":"2025-01-17T05:21:49Z","snapshot_observed_at":"2026-07-06T20:22:19.281265Z","submitted_at":"2025-01-17T05:21:49Z","title":"A Survey on Multi-Turn Interaction Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09959","snapshot_observed_at":"2026-08-06T22:02:40.944596Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.944596Z"},"links":{"cited_paper":"/paper/2501.09959","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:3707ed203770821761b5c3f7a590b363f92e18f9ad550f0d59c9d434a1aa9967","observation_id":"381dc53e-59e5-4fd9-b493-50ebe7b64b8d","resolution":{"observed_at":"2026-08-06T22:02:40.944596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13304","last_updated":"2023-06-23T05:43:28Z","snapshot_observed_at":"2026-07-06T15:45:51.145364Z","submitted_at":"2023-06-23T05:43:28Z","title":"ToolQA: A Dataset for LLM Question Answering with External Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13304","snapshot_observed_at":"2026-08-06T22:02:40.986835Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.986835Z"},"links":{"cited_paper":"/paper/2306.13304","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:5ae65fa3b7fc4a1d397fb5ce7bc1544966c251718f70f88b823a4e0f6205e79c","observation_id":"3e5d6cd4-2439-4fcc-9d6c-a6c20b2f61bf","resolution":{"observed_at":"2026-08-06T22:02:40.986835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:41.035264Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:41.035264Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:33d3b8f46a263ec663c0f5e5f24759d76a20e4014ef27ce24119b98763ce03af","observation_id":"e7d363ed-31e3-499e-9178-35297422add4","resolution":{"observed_at":"2026-08-06T22:02:41.035264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:41.100115Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:41.100115Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:1f50a5a69b466f0d96bdb1efd04102875af72242aac7ef51646b68f759e0a13d","observation_id":"6c7cba1e-c6ed-4806-8dfb-91e3dfc4747b","resolution":{"observed_at":"2026-08-06T22:02:41.100115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":5,"verified_fuzzy":3},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2506.22853."}