{"as_of":"2026-08-07T16:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e10961df6c9b009a81d97a0ded1417c08750a4033bca9ebbe01d2282484f1c6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:58:45.870083Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:18:59.715072Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-05-18T11:17:08.108565Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2401.05561"},"observation_digest":"sha256:076c4b6caae2363e36a4f872e1dbe986fb0b93d56d5df2bdf2714c19b2898993","observation_id":"bfdcb510-4117-4c31-bdb4-3897e0a75dd1","resolution":{"observed_at":"2026-05-18T11:17:08.521093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"reference_index":122,"source":"pdf_text","source_observed_at":"2026-05-13T13:43:11.024069Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2402.17177"},"observation_digest":"sha256:216711c1f1b6d6e7cc2b88574786bd26b63575ce25606e15b20a8cefe923ac20","observation_id":"15ec5b6d-4d56-46f8-a061-989c9f6bc2bc","resolution":{"observed_at":"2026-05-13T13:43:11.181459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-02T22:19:29.043854Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T03:19:00.831153Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2406.12045"},"observation_digest":"sha256:50d1247519f46ab5d01eef7fc3bf94efcae2a2facb9f2cdce38f52893a5083a6","observation_id":"55495220-d2ad-4deb-8d59-2736b19284fe","resolution":{"observed_at":"2026-05-11T03:19:00.864649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2504.19793","last_updated":"2025-08-24T03:28:21Z","snapshot_observed_at":"2026-08-01T07:24:09.967062Z","submitted_at":"2025-04-28T13:36:43Z","title":"Prompt Injection Attack to Tool Selection in LLM Agents","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T17:08:28.933831Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2504.19793"},"observation_digest":"sha256:6b685beee63a6fc77ebf69b8be8f091115a10f39cc583fa81f363674ebb49f85","observation_id":"c18c7bb9-1a8c-4176-9085-053352f1ff88","resolution":{"observed_at":"2026-05-16T17:08:28.977781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T07:52:17.174347Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2506.07982"},"observation_digest":"sha256:14c93bf65beb9ae745bf340817132ae1b010fce11c116f3eb066250261cce1ee","observation_id":"9e16af64-e263-45dc-b0d4-27ecf863a911","resolution":{"observed_at":"2026-05-12T07:52:17.470715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-07T04:58:45.870083Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use.arXiv preprint arXiv:2310.03128,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09173","last_updated":"2025-06-10T18:38:57Z","snapshot_observed_at":"2026-08-07T04:53:04.454979Z","submitted_at":"2025-06-10T18:38:57Z","title":"The Curious Language Model: Strategic Test-Time Information Acquisition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:45.870083Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2506.09173"},"observation_digest":"sha256:0687f08b619d77501e2e40f31e7ee3520e228645ecc3e281ec5275b6052c63dc","observation_id":"b59b1997-5a74-45d7-8a59-a4d8437cf4cc","resolution":{"observed_at":"2026-08-07T04:58:45.870083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-06T22:02:38.861022Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-06T21:54:49.869079Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.861022Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:5eeb6222e897e85fdd2b5b972078dfdb884766a92abfc20e112e902341e9d375","observation_id":"20756517-6596-4bec-9837-d139ff5bdd0b","resolution":{"observed_at":"2026-08-06T22:02:38.861022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-06T21:48:47.549550Z","title":"arXiv preprint arXiv:2310.03128","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23394","last_updated":"2025-06-29T20:47:27Z","snapshot_observed_at":"2026-08-06T21:41:44.763190Z","submitted_at":"2025-06-29T20:47:27Z","title":"Teaching a Language Model to Speak the Language of Tools","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:48:47.549550Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2506.23394"},"observation_digest":"sha256:44b46fc7379428bff729c2e611cb46addc24b6254376588cfa81530eac67fe26","observation_id":"6ac1df20-9361-4c43-82c9-f4898d7e2d0e","resolution":{"observed_at":"2026-08-06T21:48:47.549550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-06T21:22:43.754386Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use // arXiv preprint arXiv:2310.03128","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00487","last_updated":"2025-07-02T04:35:44Z","snapshot_observed_at":"2026-08-06T21:11:41.074985Z","submitted_at":"2025-07-01T07:02:26Z","title":"MassTool: A Multi-Task Search-Based Tool Retrieval Framework for Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:43.754386Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2507.00487"},"observation_digest":"sha256:3a77fdc750b23b9ffc08cfcf446f136e7bf70999ddd56f4637f0b203d7033842","observation_id":"337c765f-ae53-452a-8937-39caf61300d2","resolution":{"observed_at":"2026-08-06T21:22:43.754386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-06T15:39:57.024887Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15296","last_updated":"2025-07-21T06:55:37Z","snapshot_observed_at":"2026-08-06T15:33:04.507427Z","submitted_at":"2025-07-21T06:55:37Z","title":"Butterfly Effects in Toolchains: A Comprehensive Analysis of Failed Parameter Filling in LLM Tool-Agent Systems","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:39:57.024887Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2507.15296"},"observation_digest":"sha256:edb8837f6bf588b87d62097a16dab7f9a0c8021168796eafb47a324fe8754571","observation_id":"0b1ca4a9-c1c7-4390-8c31-1e095790d3e2","resolution":{"observed_at":"2026-08-06T15:39:57.024887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-06T15:20:38.656905Z","title":"Yue Huang, Jiawen Shi, Yuan Li, Chenrui Fan, Siyuan Wu, Qihui Zhang, Yixin Liu, Pan Zhou, Yao Wan, Neil Zhenqiang Gong, and Lichao Sun","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16217","last_updated":"2025-08-29T18:45:22Z","snapshot_observed_at":"2026-08-06T15:12:57.737368Z","submitted_at":"2025-07-22T04:21:03Z","title":"Towards Compute-Optimal Many-Shot In-Context Learning","version":2},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-06T15:20:38.656905Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2507.16217"},"observation_digest":"sha256:a921de837dc46248f2f81dbba15f7195ec7c4cea5826d280fff674c910385e69","observation_id":"22550fcd-f160-4d2f-bbd9-269ad5bc33d1","resolution":{"observed_at":"2026-08-06T15:20:38.656905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2507.21035","last_updated":"2026-05-17T21:43:43Z","snapshot_observed_at":"2026-07-06T22:04:01.721229Z","submitted_at":"2025-07-28T17:55:08Z","title":"GenoMAS: A Multi-Agent Framework for Scientific Discovery via Code-Driven Gene Expression Analysis","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T00:37:11.945418Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2507.21035"},"observation_digest":"sha256:8bec7c93786400783baaff67402b30b9106a43592fc6d32e52a392e4d53833e9","observation_id":"51babeb4-227a-4516-95b0-2f094cd24194","resolution":{"observed_at":"2026-05-22T00:40:51.463887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-06T12:44:21.609937Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.609937Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:9d9ae8d170b184a71cf07e9170a53327981385d7331bf89c635097f5325f7d35","observation_id":"1576480d-e593-4139-8f1a-353f60d92f52","resolution":{"observed_at":"2026-08-06T12:44:21.609937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-06T12:09:26.335428Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22034","last_updated":"2025-07-29T17:34:12Z","snapshot_observed_at":"2026-08-07T11:10:57.211048Z","submitted_at":"2025-07-29T17:34:12Z","title":"UserBench: An Interactive Gym Environment for User-Centric Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T12:09:26.335428Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2507.22034"},"observation_digest":"sha256:b1ed45b541a8534561204f2d81c426523c4ea952c78ff72f2fb24b95af54f86e","observation_id":"67a0b2f9-4580-4f30-9e34-68085d9089bd","resolution":{"observed_at":"2026-08-06T12:09:26.335428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-05T18:46:16.475327Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14323","last_updated":"2025-08-25T04:46:11Z","snapshot_observed_at":"2026-08-05T18:46:13.408935Z","submitted_at":"2025-08-20T00:35:50Z","title":"Beyond Semantic Similarity: Reducing Unnecessary API Calls via Behavior-Aligned Retriever","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T18:46:16.475327Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2508.14323"},"observation_digest":"sha256:488d195b885c92da59110456f53809eb5ddebf77fe01b123a2df0288d78616db","observation_id":"915671c3-e5cc-4ec2-9679-5d17a1a45d50","resolution":{"observed_at":"2026-08-05T18:46:16.475327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2510.02837","last_updated":"2026-05-25T02:56:44Z","snapshot_observed_at":"2026-08-04T12:44:10.998140Z","submitted_at":"2025-10-03T09:19:15Z","title":"Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T11:02:55.529271Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2510.02837"},"observation_digest":"sha256:bde7ec48156bae532fcc7f1de5d18e97eb5ee7f69e497db4ffc79ed68785aab5","observation_id":"a03ba34e-3ea1-4c44-a50e-849e2df3cda7","resolution":{"observed_at":"2026-05-18T11:06:17.792208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-04T12:44:12.592641Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use.arXiv preprint arXiv:2310.03128,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02837","last_updated":"2026-05-25T02:56:44Z","snapshot_observed_at":"2026-08-04T12:44:10.998140Z","submitted_at":"2025-10-03T09:19:15Z","title":"Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T12:44:12.592641Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2510.02837"},"observation_digest":"sha256:44bd448fb31c259c93f753bc2320917499041eaff01e43029e9b4ef94387ab21","observation_id":"0e9d9af4-cf15-48a8-824e-b99be0ce07c2","resolution":{"observed_at":"2026-08-04T12:44:12.592641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2510.23853","last_updated":"2026-04-15T18:39:35Z","snapshot_observed_at":"2026-07-06T22:34:13.674208Z","submitted_at":"2025-10-27T20:51:58Z","title":"Your LLM Agents are Temporally Blind: The Misalignment Between Tool Use Decisions and Human Time Perception","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T03:46:03.228969Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2510.23853"},"observation_digest":"sha256:3b188506dca28b115343d5a3eced5df48aaa6bc2e9429bb112842564e7f44f57","observation_id":"523d99e1-82e0-4b96-84b8-3501b8c110a9","resolution":{"observed_at":"2026-05-18T03:50:52.539483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2512.13564","last_updated":"2026-01-13T09:33:57Z","snapshot_observed_at":"2026-08-06T08:27:07.254588Z","submitted_at":"2025-12-15T17:22:34Z","title":"Memory in the Age of AI Agents","version":2},"reference_index":261,"source":"arxiv_source","source_observed_at":"2026-05-11T18:18:19.911342Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2512.13564"},"observation_digest":"sha256:f3b69ccf2bcd447c0f58c192a02ee656c04df28b94ecd718be3bb28c1dac222e","observation_id":"0700dca1-1a6d-46f8-8cd4-7a0dabd4525f","resolution":{"observed_at":"2026-05-11T18:18:20.250588Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-03T09:21:36.280577Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.14192","last_updated":"2026-07-03T11:26:58Z","snapshot_observed_at":"2026-08-07T15:05:40.772054Z","submitted_at":"2026-01-20T17:51:56Z","title":"Toward Efficient Agents: Memory, Tool learning, and Planning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T09:21:36.280577Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2601.14192"},"observation_digest":"sha256:f65645b9bb9555c784e1f1064c91539878b539734ae4e96d909d22cfcf8e71b4","observation_id":"ad97d443-4774-437f-b967-c37f48d6ce05","resolution":{"observed_at":"2026-08-03T09:21:36.280577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-02T21:46:33.268448Z","title":"Z., and Sun, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19218","last_updated":"2026-06-09T15:02:00Z","snapshot_observed_at":"2026-08-05T17:29:43.215311Z","submitted_at":"2026-02-22T15:02:00Z","title":"Gecko: A Simulation Environment with Stateful Feedback for Refining Agent Tool Calls","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T21:46:33.268448Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2602.19218"},"observation_digest":"sha256:f9eb093ae0f97ef704edea15d8defe652840a5c2ecf0d3a02414a287fdaff8e7","observation_id":"59ec2ede-71a8-4033-86a9-01bfcebf3c9f","resolution":{"observed_at":"2026-08-02T21:46:33.268448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-14T19:59:59.030585Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.00137","last_updated":"2026-07-10T22:46:45Z","snapshot_observed_at":"2026-08-04T07:28:22.927886Z","submitted_at":"2026-03-31T18:42:36Z","title":"Open, Reliable, and Collective: A Community-Driven Framework for Tool-Using AI Agents","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-14T19:59:59.030585Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2604.00137"},"observation_digest":"sha256:8198bfe5ef4afd1f2b18bcbc7958c534a34c67312bde0121d931b3b7554f188d","observation_id":"4b853e52-1d2d-404e-83a7-6d6775680c58","resolution":{"observed_at":"2026-07-14T19:59:59.030585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2605.00737","last_updated":"2026-08-06T13:58:03Z","snapshot_observed_at":"2026-08-07T15:27:58.628944Z","submitted_at":"2026-05-01T15:38:13Z","title":"To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-09T19:32:57.054584Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.00737"},"observation_digest":"sha256:53e32c57c7cd3fb2f75d8fa6f77c8810a9339f487ff54f88cd7e8172783f5a94","observation_id":"4f2bdf27-338b-487a-8c00-d32a047c8fd4","resolution":{"observed_at":"2026-05-11T15:36:10.333342Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2605.02411","last_updated":"2026-07-31T18:57:52Z","snapshot_observed_at":"2026-08-06T23:11:08.908082Z","submitted_at":"2026-05-04T10:01:24Z","title":"FitText: Evolving Agent Tool Ecologies via Memetic Retrieval","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-08T19:04:53.639217Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.02411"},"observation_digest":"sha256:7e44e6c168f3e07ada67fd9f6b3b42937f9874970bb368859c84a3199ab5da67","observation_id":"4a5476e6-df85-4c89-9155-3d38d16c87f8","resolution":{"observed_at":"2026-05-09T06:05:33.837524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2605.02411","last_updated":"2026-07-31T18:57:52Z","snapshot_observed_at":"2026-08-06T23:11:08.908082Z","submitted_at":"2026-05-04T10:01:24Z","title":"FitText: Evolving Agent Tool Ecologies via Memetic Retrieval","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-01T00:25:46.507401Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.02411"},"observation_digest":"sha256:d1f5f99944b0eca517f4657a74847971ce7be26027e9abab808621ea6807d5a0","observation_id":"d00cbb03-51f7-491b-9c00-d4a541116888","resolution":{"observed_at":"2026-07-01T00:45:12.424114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-04T05:24:44.710671Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.02411","last_updated":"2026-07-31T18:57:52Z","snapshot_observed_at":"2026-08-06T23:11:08.908082Z","submitted_at":"2026-05-04T10:01:24Z","title":"FitText: Evolving Agent Tool Ecologies via Memetic Retrieval","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T05:24:44.710671Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.02411"},"observation_digest":"sha256:95c19ec65592eaf5575a45f2070c7ca4a4bd5cc844b2bdcf01c35e41d4dd08d8","observation_id":"f87b296a-6676-48f1-9d59-9f30edbfe7a2","resolution":{"observed_at":"2026-08-04T05:24:44.710671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2605.02682","last_updated":"2026-05-04T15:00:37Z","snapshot_observed_at":"2026-08-03T00:40:33.048580Z","submitted_at":"2026-05-04T15:00:37Z","title":"Hybrid Inspection and Task-Based Access Control in Zero-Trust Agentic AI","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T19:06:36.952203Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.02682"},"observation_digest":"sha256:22dea1ae43631b0abe1f852aa297ef340346a177f905db267a6cd003bac032a4","observation_id":"7709fb7c-2ad0-4ef3-886e-0853e6383a01","resolution":{"observed_at":"2026-05-09T06:00:37.672983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2605.03986","last_updated":"2026-05-05T17:08:26Z","snapshot_observed_at":"2026-07-06T23:16:49.553583Z","submitted_at":"2026-05-05T17:08:26Z","title":"From Intent to Execution: Composing Agentic Workflows with Agent Recommendation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T16:19:39.392516Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.03986"},"observation_digest":"sha256:907c624ea3a02082b9def39345a6c8f10aad5eb1f00776f0b3295ec9d381976a","observation_id":"684b6e09-e7cb-4db7-9017-2bb70f976afd","resolution":{"observed_at":"2026-05-11T23:46:42.967662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2605.07251","last_updated":"2026-05-08T05:19:59Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T05:19:59Z","title":"Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T01:29:47.384341Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.07251"},"observation_digest":"sha256:5e43b4bb08ef1ad85f9810b55dcc7c9012d0810c843983991e9a5eda5b68fa19","observation_id":"a86b0777-73cc-4fea-906b-4dfb1a7f260f","resolution":{"observed_at":"2026-05-11T01:45:51.785672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2605.14038","last_updated":"2026-05-17T15:23:37Z","snapshot_observed_at":"2026-08-03T15:23:23.551096Z","submitted_at":"2026-05-13T18:59:28Z","title":"Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:54.252816Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.14038"},"observation_digest":"sha256:12cca4f764f039c53730714e8d35b5dbca8a9ffcb0d580f5c8e9a1af9ab82113","observation_id":"b053461d-5763-4d1d-8f70-7b549a050ee9","resolution":{"observed_at":"2026-05-15T05:35:04.476298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2605.14038","last_updated":"2026-05-17T15:23:37Z","snapshot_observed_at":"2026-08-03T15:23:23.551096Z","submitted_at":"2026-05-13T18:59:28Z","title":"Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T20:52:20.975459Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.14038"},"observation_digest":"sha256:03e866c00702b4577b4538c3079874556ada70074e956307034749184cfc87fc","observation_id":"3e545d30-a3b9-44e7-b915-75cc50001943","resolution":{"observed_at":"2026-05-20T20:53:43.552641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2605.14892","last_updated":"2026-05-15T09:12:41Z","snapshot_observed_at":"2026-08-07T13:04:48.115170Z","submitted_at":"2026-05-14T14:36:13Z","title":"Beyond Individual Intelligence: Surveying Collaboration, Failure Attribution, and Self-Evolution in LLM-based Multi-Agent Systems","version":1},"reference_index":164,"source":"arxiv_source","source_observed_at":"2026-05-15T03:07:38.232966Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.14892"},"observation_digest":"sha256:ac68aeb44ca5b187dff4d9105db21a34768d684e0622ff2ab692cc6a2b1e9948","observation_id":"d473db4c-3e82-4cd3-9767-bcb8063c5b44","resolution":{"observed_at":"2026-05-15T03:08:57.998107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2605.14892","last_updated":"2026-05-15T09:12:41Z","snapshot_observed_at":"2026-08-07T13:04:48.115170Z","submitted_at":"2026-05-14T14:36:13Z","title":"Beyond Individual Intelligence: Surveying Collaboration, Failure Attribution, and Self-Evolution in LLM-based Multi-Agent Systems","version":2},"reference_index":165,"source":"arxiv_source","source_observed_at":"2026-05-19T16:51:13.491389Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.14892"},"observation_digest":"sha256:2f9adf61f15799fba7e0668de6824d34499832c42a9bf86173ff984815238277","observation_id":"749d96c9-e863-41ee-9a88-6548c8b301dd","resolution":{"observed_at":"2026-05-19T16:52:39.943407Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2605.22177","last_updated":"2026-05-21T08:47:49Z","snapshot_observed_at":"2026-08-02T13:10:19.838403Z","submitted_at":"2026-05-21T08:47:49Z","title":"Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T07:51:13.362986Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.22177"},"observation_digest":"sha256:4b4c3f7056bd57526fcaa84b2c6a90c8f429a39b51da5c08a765625cd4ebcd09","observation_id":"b36e908b-d4c6-4335-a441-73f48c1b2f6c","resolution":{"observed_at":"2026-05-22T07:51:15.401757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2605.26154","last_updated":"2026-05-24T04:26:13Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-24T04:26:13Z","title":"MemMorph: Tool Hijacking in LLM Agents via Memory Poisoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T00:25:59.532059Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2605.26154"},"observation_digest":"sha256:3af6775a1c2b405ef5bdd89e743fdf32e7abc6c18124b73f37cd5263f55fae68","observation_id":"b7301589-2913-4ce2-9e68-39c437d74e07","resolution":{"observed_at":"2026-07-01T16:35:50.732455Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2606.00251","last_updated":"2026-05-29T18:32:14Z","snapshot_observed_at":"2026-08-02T17:00:44.481600Z","submitted_at":"2026-05-29T18:32:14Z","title":"Capability Self-Assessment: Teaching LLMs to Know Their Limits","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T22:25:50.579196Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2606.00251"},"observation_digest":"sha256:e375c68863f16af867afd00d1fc472a4f92c82206f4929d8566f8485ad03de92","observation_id":"df94b234-2959-4db7-a73e-2469787000e9","resolution":{"observed_at":"2026-06-28T22:32:44.643921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2606.06566","last_updated":"2026-06-04T17:27:39Z","snapshot_observed_at":"2026-08-06T00:01:29.832904Z","submitted_at":"2026-06-04T17:27:39Z","title":"NTILC: Neural Tool Invocation via Learned Compression","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T00:05:36.600389Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2606.06566"},"observation_digest":"sha256:4a058a8f0e2b7e58af705c11f0843020dee970e7e9558e5bda584da5c8e73f8a","observation_id":"0cbf862b-fdcf-46a9-adff-cdc6cc2f28a2","resolution":{"observed_at":"2026-07-02T15:07:04.773446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2606.06667","last_updated":"2026-07-06T17:01:35Z","snapshot_observed_at":"2026-08-02T12:07:09.543257Z","submitted_at":"2026-06-04T19:32:00Z","title":"The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T01:34:23.382705Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2606.06667"},"observation_digest":"sha256:663694fbbc0373f45c660dd77dc54dcefebb62e12393c2badf3b72729ff18b71","observation_id":"7f6a9ba2-b68d-4f41-8fe9-02eb8f016c6e","resolution":{"observed_at":"2026-07-02T13:06:59.155289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-12T14:59:04.152474Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use.arXiv preprint arXiv:2310.03128,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06667","last_updated":"2026-07-06T17:01:35Z","snapshot_observed_at":"2026-08-02T12:07:09.543257Z","submitted_at":"2026-06-04T19:32:00Z","title":"The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T14:59:04.152474Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2606.06667"},"observation_digest":"sha256:bb6bcf69888e93c93821763035abf455b059d868a60a82a0afdd3e2487e3bbbf","observation_id":"c152ec48-6f8b-4634-82ed-6532c4cc7091","resolution":{"observed_at":"2026-07-12T14:59:04.152474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":"2310.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-07-03T21:18:59.715072Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"b02ef874-7bf1-4042-b075-bed194bafa8e","year":2023},"citing_paper":{"arxiv_id":"2606.18051","last_updated":"2026-06-16T15:27:55Z","snapshot_observed_at":"2026-08-07T03:31:46.971110Z","submitted_at":"2026-06-16T15:27:55Z","title":"Compositional Skill Routing for LLM Agents: Decompose, Retrieve, and Compose","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T00:37:50.570757Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2606.18051"},"observation_digest":"sha256:b06ba688a99e02df7ed1171e8b66dbbae71e4869d8154972acec4dd6785ce165","observation_id":"b490de2a-c3a7-4ef9-8b45-7932e70decb2","resolution":{"observed_at":"2026-07-03T21:18:59.716659Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-01T01:35:09.657698Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25765","last_updated":"2026-07-28T14:19:59Z","snapshot_observed_at":"2026-08-07T07:35:13.308973Z","submitted_at":"2026-07-28T14:19:59Z","title":"WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T01:35:09.657698Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2607.25765"},"observation_digest":"sha256:d0785b3b03e79ca58c4b55fbdb310e5a84bf3865a79014c715e35fdd7bc05769","observation_id":"cf78261e-76a9-4938-8b66-59b2e68a263f","resolution":{"observed_at":"2026-08-01T01:35:09.657698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-03T00:55:29.777251Z","title":"arXiv preprint arXiv:2310.03128 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28636","last_updated":"2026-05-19T13:56:13Z","snapshot_observed_at":"2026-08-06T00:38:04.006327Z","submitted_at":"2026-05-19T13:56:13Z","title":"Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges","version":1},"reference_index":156,"source":"arxiv_source","source_observed_at":"2026-08-03T00:55:29.777251Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2607.28636"},"observation_digest":"sha256:c6368efcbcd92e973bcfb0694d13a2fb0c5e65d7811c74c9bb27418dc21bad96","observation_id":"f5bd2c1c-a64a-4a8f-bc81-35180af2a342","resolution":{"observed_at":"2026-08-03T00:55:29.777251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.03128/citation-record","integrity":"/paper/2310.03128/integrity","json":"/paper/2310.03128/citation-record.json","paper":"/paper/2310.03128"},"outbound":[],"paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","latest_version":6,"primary_category":"cs.SE","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 42 inbound Pith citation observations for arXiv:2310.03128."}