{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:DGII2DN2AG7JNMLKUUFQMLKD6V","short_pith_number":"pith:DGII2DN2","schema_version":"1.0","canonical_sha256":"19908d0dba01be96b16aa50b062d43f56a286c5a5d256887f72c73607212da53","source":{"kind":"arxiv","id":"2505.10495","version":1},"attestation_state":"computed","paper":{"title":"RouteNator: A Router-Based Multi-Modal Architecture for Generating Synthetic Training Data for Function Calling LLMs","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Cheng Chen, Dewang Sultania, Ishita Verma, Michael Friedrich, Suhas Suresha, Tracy Holloway King, Tushar Vatsa, Vibha Belavadi","submitted_at":"2025-05-15T16:53:45Z","abstract_excerpt":"This paper addresses fine-tuning Large Language Models (LLMs) for function calling tasks when real user interaction data is unavailable. In digital content creation tools, where users express their needs through natural language queries that must be mapped to API calls, the lack of real-world task-specific data and privacy constraints for training on it necessitate synthetic data generation. Existing approaches to synthetic data generation fall short in diversity and complexity, failing to replicate real-world data distributions and leading to suboptimal performance after LLM fine-tuning. We p"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.10495","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-05-15T16:53:45Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"708f7d62ee750a5e20998c59a7a62a17ee2903852c5b23ff46247aa94c125e4a","abstract_canon_sha256":"e34ccda1499629dca8e6ec3f3742d791e6c9c0cedb88decfc12b8d6a1bb0ae8f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:07:45.507775Z","signature_b64":"dWjdAwJKji7pck8OLIWDS6vDW/AnZgTfPED4W3F3FZ1hIUYYc+xVouWnO76o3Y1dXZU2bp1UxkvjGM9j/jLpDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"19908d0dba01be96b16aa50b062d43f56a286c5a5d256887f72c73607212da53","last_reissued_at":"2026-07-05T11:07:45.507215Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:07:45.507215Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RouteNator: A Router-Based Multi-Modal Architecture for Generating Synthetic Training Data for Function Calling LLMs","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Cheng Chen, Dewang Sultania, Ishita Verma, Michael Friedrich, Suhas Suresha, Tracy Holloway King, Tushar Vatsa, Vibha Belavadi","submitted_at":"2025-05-15T16:53:45Z","abstract_excerpt":"This paper addresses fine-tuning Large Language Models (LLMs) for function calling tasks when real user interaction data is unavailable. In digital content creation tools, where users express their needs through natural language queries that must be mapped to API calls, the lack of real-world task-specific data and privacy constraints for training on it necessitate synthetic data generation. Existing approaches to synthetic data generation fall short in diversity and complexity, failing to replicate real-world data distributions and leading to suboptimal performance after LLM fine-tuning. We p"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.10495","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.10495/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.10495","created_at":"2026-07-05T11:07:45.507278+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.10495v1","created_at":"2026-07-05T11:07:45.507278+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.10495","created_at":"2026-07-05T11:07:45.507278+00:00"},{"alias_kind":"pith_short_12","alias_value":"DGII2DN2AG7J","created_at":"2026-07-05T11:07:45.507278+00:00"},{"alias_kind":"pith_short_16","alias_value":"DGII2DN2AG7JNMLK","created_at":"2026-07-05T11:07:45.507278+00:00"},{"alias_kind":"pith_short_8","alias_value":"DGII2DN2","created_at":"2026-07-05T11:07:45.507278+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.07112","citing_title":"Switchcraft: AI Model Router for Agentic Tool Calling","ref_index":6,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DGII2DN2AG7JNMLKUUFQMLKD6V","json":"https://pith.science/pith/DGII2DN2AG7JNMLKUUFQMLKD6V.json","graph_json":"https://pith.science/api/pith-number/DGII2DN2AG7JNMLKUUFQMLKD6V/graph.json","events_json":"https://pith.science/api/pith-number/DGII2DN2AG7JNMLKUUFQMLKD6V/events.json","paper":"https://pith.science/paper/DGII2DN2"},"agent_actions":{"view_html":"https://pith.science/pith/DGII2DN2AG7JNMLKUUFQMLKD6V","download_json":"https://pith.science/pith/DGII2DN2AG7JNMLKUUFQMLKD6V.json","view_paper":"https://pith.science/paper/DGII2DN2","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.10495&json=true","fetch_graph":"https://pith.science/api/pith-number/DGII2DN2AG7JNMLKUUFQMLKD6V/graph.json","fetch_events":"https://pith.science/api/pith-number/DGII2DN2AG7JNMLKUUFQMLKD6V/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DGII2DN2AG7JNMLKUUFQMLKD6V/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DGII2DN2AG7JNMLKUUFQMLKD6V/action/storage_attestation","attest_author":"https://pith.science/pith/DGII2DN2AG7JNMLKUUFQMLKD6V/action/author_attestation","sign_citation":"https://pith.science/pith/DGII2DN2AG7JNMLKUUFQMLKD6V/action/citation_signature","submit_replication":"https://pith.science/pith/DGII2DN2AG7JNMLKUUFQMLKD6V/action/replication_record"}},"created_at":"2026-07-05T11:07:45.507278+00:00","updated_at":"2026-07-05T11:07:45.507278+00:00"}