LLM Tool Calling Optimization
Abstract
Büyük Dil Modelleri (Large Language Models) son yıllarda gelişen
teknoloji ve açık kaynaklı yazılımlar ile beraber doğal dil işleme
görevlerinde üstün başarı göstererek 2023 yılının başlarından itibaren
günümüze kadar çoğu insanın artık günlük hayatına doğrudan entegre
olmuştur(Fan et al.
2023). Ancak yaygınlaşmaya başladıktan sonra doğal dil işleme
temellerinden dolayı güncel bilgiye erişim eksikliği, saat kaç, tarih
nedir gibi anlık basit işlemlere cevap verememesi, matematiksel işlem
hataları gibi görevlerde statik parametre yapıları nedeniyle sınırlı
kalmışlardı ancak kısıtlamaları aşmak için ortaya atılan "Araç Çağırma"
(Tool Calling) mekanizması harici araçlar, API’ler ve fonksiyonlar ile
etkileşime girmesi, yakın geçmişten itibaren günümüzde yapay zeka
sistemlerinin yeteneklerini köklü biçimde genişletmiştir. Bu değişim
beraberinde LLM’in işlem maliyetinin üzerine ek olarak Tool Calling
işlemleri için token sayısını ve dolayısıyla maliyeti önemli ölçüde
artırmıştır(Ding,
Zhu, and Liu 2025). Tool Calling süreci; doğruluk, maliyet,
gecikme, güvenilirlik ve ölçeklenebilirlik gibi kalemlerde önemli
optimizasyon problemlerini de beraberinde getirmektedir. Bu çalışma Tool
Calling performans ve maliyet hesaplarının optimizasyonu üzerine son
yıllardaki yayınlanan önemli akademik çalışmaları incelemektedir.
Anahtar Kelimeler: Large Language Models, Tool Calling, Optimization
Giriş
LLM’ler başlarda sadece gelişmiş doğal dil işleme temelleri ile metin üretme, anlama ve cevap verme görevleri için tasarlanmışken günümüzde arama motorları kullanarak güncel veriye ulaşma, veritabanları, hesaplama araçları, kod çalıştırma ortamları ve kurumsal API’ler gibi çok çeşitli dış sistemlerle entegre biçimde çalışabilmektedir. Bu entegrasyonlar Tool Calling mekanizması üzerine çalışarak, LLM’leri sadece metin tabanlı işlemlerden aktif karar veren, cevap üreten ve gerekli eylemleri yapabilen alan otomasyon (LLM Agent) sistemlerine dönüşmüştür.
LLM’lerin akıl yürütme yeteneğindeki son gelişmeler, LLM’lerin uygulanabilirliğini metin üretiminin ötesine geçerek, karmaşık problemleri çözmeye kadar genişletti ve son çalışmalar ayrıca bu akıl yürütme yeteneğinin karmaşık ve mantıksal görevleri çözmede doğruluğu artırmada nasıl faydalı olabileceğini göstermiştir(Besta et al. 2024). Akıl yürütme yeteneği ayrıca Tool Calling yeteneğini de sağlamıştır. LLM’ler verilen araçları çağırabilir ve araçların sonucu verilen görevlerini tamamlamalarına yardımcı olmak için kullanabilir. Bu araçlar, basit işlemleri, araştırmaları yapabilen LLM’den daha karmaşık LLM tabanlı işlemlere kadar uzanmaktadır.
Araç çağırma, bir LLM’nin konuşma oluşturma sırasında harici araçlarla etkileşim kurmasına olanak tanır. Bu, LLM’nin kendi bilgi tabanının ötesindeki bilgilere erişebileceği veya eylemler gerçekleştirebileceği anlamına gelir. Araçlar, geliştiriciler tarafından yazılan fonksiyonlar, harici hizmetler için API’ler veya LLM’nin etkileşim kurabileceği herhangi bir kaynak olabilir.
Şekil 1 gösterildiği gibi LLM tabanlı sistemde Tool Calling süreci genellikle şu adımlardan geçer:
- Araç çağrısına gerek olup olmadığına karar verme
- Hangi aracın seçileceğini belirleme (Tool Selection)
- Araç parametrelerinin doğru şekilde üretilmesi
- Araç çıktısının yorumlanması ve sonraki adımlara entegre edilmesi
- Hata durumlarında yeniden deneme veya alternatif araçlara yönelme
LLM’lerin çeşitli araçları çağırma mekanizmasını entegre etme, LLM tabanlı yazılımları geliştirmede temel bir değişim sağlamıştır. Yao ve arkadaşları tarafından 2022 yılında yayınlanan çalışma ile LLM Tool Calling yada birden fazla görev için birden fazla Tool Calling yapabilme mekanizması üzerine bir çalışmadır. Bu çalışma Tool Calling üzerine yapılmış öncü çalışmalar biridir. Modelin cevap vermeden önce akıl yürütmesi ve eylem sonucunu inceleyerek bir sonraki adımı planlaması prensibine dayanır. Bu yöntem, özellikle çok adımlı problemlerde hata yayılımını azaltarak süreç optimizasyonu sağlar(Yao et al. 2022).
Yao ve arkadaşlarının yayını bu alanda öncü bir çalışma olmuştur ve son kullanıcıya hizmet veren birkaç modele entegre edilmiştir. Ancak, bu yaklaşım çoklu Tool Calling çağrılarını ardışık olarak ele aldığı için daha karmaşık problemlerde önemli optimizasyonlar gerektiği ortaya çıkmıştır. Çalışmada öne sürülen mekanizma çağrılarını gerçekleştirir ve gözlemlerini sırayla üzerinde düşünür. Bu yaklaşım, her akıl yürütme ve işlem adımı için ardışık Tool Calling işlemleri ile beraber tekrarlayan LLM çağrıları nedeniyle gecikme ve maliyet açısından verimsizliklere yol açabilmektedir(Xu et al. 2023).
Tool Calling mekanizması modelin sınırlamalarının dışındaki bilgilere ulaşma, hesaplama doğruluğunu artırma ve güncel verilere ulaşma gibi avantajlar sunarken diğer yandan ek işlemler yaparak ek maliyetler ile beraber gelmektedir bunun yanı sıra yanlış veya gereksiz araç çağırma durumunda ciddi performans ve maliyet sorunlarına yol açabilmektedir. Bu nedenle Tool Calling, sadece bir süreç mekanizması yada mimarisi değil, aynı zamanda bir planlama, karar verme ve optimizasyon problemi olarak ele alınmalıdır.
Metodoloji
Bu bölümde çalışma içerisinde kullanım temel kavramlar, tanımlar ve temel zorlukları detaylandırmaktadır.
Temel Kavramlar ve Tanımlar
LLM doğal dil işleme sınırlarının dışındaki bilgiye dinamik olarak erişerek ve bunlara göre hareket ederek karmaşık görevleri tamamlamasına olanak tanır.
Sadece soruları yanıtlamak yerine, Tool Calling özelliğine sahip modeller iş akışlarını göre otomatikleştirebilir, veritabanlarıyla etkileşim kurabilir, çok adımlı problem çözme işlemleri gerçekleştirebilir, gerçek zamanlı kararlar alabilir ve daha fazlasını yapabilir.
Bu değişim, LLM’leri pasif asistanlardan ziyade karmaşık görevleri yerine getirebilen büyük otomasyon sistemleri (Agent) dönüştürüyor.
Tool Calling, modelin harici araçlarla etkileşimini kolaylaştırmak için birlikte çalışan birkaç temel bileşeni içerir.
İlk adım, yeterli bilgiye sahip olmadığını veya bir isteği tamamlamak için harici bir fonksiyona ihtiyaç duyduğunu anlamasıdır.
İkinci adım, seçim mekanizması; arama motoru, veritabanı veya hesaplama kaynağı gibi belirli görevi yerine getirmek için uygun araçları belirler.
Ardından bir araç seçildiğinde, API arayüzü devreye girer ve modelin önceden tanımlanmış sorgular göndermesine ve araç tarafından okunabilir biçimde yanıtlar almasına olanak tanır.
Son olarak, yanıt işleme sistemi, alınan verilerin doğru biçimde
biçimlendirilmesini ve kullanıcıya anlamlı bir şekilde sunulmasını
sağlamaya yardımcı olur.
Araç Kullanım Döngüsü:
- Perception: Kullanıcı talebini anlama
- Planning: Hangi araçların hangi sırada kullanılacağına karar verme
- Tool Selection: Mevcut araçlardan uygun olanı seçme
- Parameter Generation: Araç için gerekli verileri üretme
- Execution: Aracı çağırma ve sonuç alma
- Observation: Sonucu değerlendirme
- Re-planning: Gerekirse döngüyü tekrarlama
Temel Zorluklar
Tool Calling LLM’lerin sınırlarını aşmasına olanak sağlar ancak hem model mimarisi hem de sistem tasarımı açısından çeşitli zorlukları beraberinde getirmektedir.
Doğru Araç Seçimi Problemi (Tool Selection) LLM’lerin, bir görev için hangi aracın çağrılması gerektiğine karar vermesi önemli bir zorluktur. Araç sayısı artıkça model karar verme aşamasında daha fazla veri işleme, anlamam ve karar verme aşamasında geçeceği için gereksiz maliyet artışına sebep olabilir bunun yanı sıra yanlış araç seçiminde hatalı çıktı üretiminden zincirleme şekilde yanlış yönelimlere neden olabilir.
Doğru Veri Üretimi (Parameter Generation) Tool Calling işlemlerinde doğru aracın seçilmesi yeterli değildir aynı zamanda seçilen araç için modelin sınırları içerisinde aracın ihtiyaç duyduğu doğru veriyi üretmesi gerekmektedir. Doğru parametrelerin, doğru veri tipleriyle, araç ile arasındaki şemaya uygun şekilde üretilmesi gerekmektedir.
Çoklu Araçlarda Planlama (Planning) Karmaşık görevler için model genellikle çok adımlı planlamalar yapar.BU iş akış sırasında ilk adımda yapılacak küçük bir hata, sonraki tüm adımları geçersiz kılabilir.
LLM’ler, ara adımlarda kendi çıktılarının doğruluğunu değerlendirmede sınırlı olduğu için hata tespiti ve geri dönüş mekanizmaları yetersiz kalabilmektedir.
Hata Toleransı (Execution) Araç çağırma sırasında karşılaşılan hatalara karşı dayanıklılık, sistem güvenilirliği açısından kritik bir zorluktur. Ağ kesintileri, zaman aşımı, geçersiz parametreler veya beklenmeyen yanıt veya formatlar gibi araç kaynaklı hatalar, çok adımlı görev akışlarını kesintiye uğratabilir.
Maliyet ve Performans Her araç çağrısı model için ek hesaplama maliyeti, araç sonucu almak için beklenen süre, daha fazla token ve context window kullanılması anlamına gelmektedir.
Bu nedenle gereksiz veya tekrar eden araç çağırma işlemleri, sistemin performansını ve ekonomik anlamda daha fazla maliyet artıracağı için sistemin zorlaştırmaktadır.
Güvenlik ve Yetkilendirme Tool Calling mekanizmaları, LLM’lere harici sistemlere erişim yetkisi verildiğinde; Yetkisiz veri erişimi, Kötü niyetli kullanıcılar tarafından kötü amaçla kullanılma gibi güvenlik risklerini doğurur.
Literatürde Tool Calling
Literatürdeki mevcut araştırmalar, LLM’lerin araçları doğru bir şekilde nasıl kullanacaklarını öğretmeye yönelik daha fazla araştırmalar yapılmaktadır, ancak son aylardaki çalışmalar modellerin problemleri daha etkili bir şekilde çözmek için kendi araçlarını geliştirmelerine izin vermeyi keşfetmeye başlamıştır. Modeller için araç kullanmanın veya geliştirmenin çeşitli aşamalarını kapsamlı bir şekilde anlamak amacıyla, büyük modeller için harici araçların kullanımına yönelik standart bir yöntem şuanda olmasada bu alanda bir çok çalışma ortaya bir fikir atmaya çalışmaktadır (Qian et al. 2023).
Bu bölümde Tool Calling ve farklı yaklaşımlar üzerine son yıllarda yapılmış çalışmaları göstermektedir. Literatürdeki çalışmalar, doğruluk, maliyet ve entegrasyon hedeflerine göre üç ana kategoride toplanabilir.
Modelin cevap verme eğilimini değiştirmeden, Chain-of-Thought (Düşünce Zinciri) ve benzeri stratejilerle araç kullanımının doğruluğunu artırmayı hedefleyen çalışmalardır.
Yao ve arkadaşları tarafından 2023 yılında yayınlanan ReAct isimli mekanizma, Tool Calling ve Akıl Yürütme sistemlerinin literatürün temel taşlarından biridir. Modelin eylem yapmadan önce akıl yürütmesi ve eylem sonucunu gözlemleyerek bir sonraki adımı planlaması prensibine dayanır. Bu yöntem, özellikle karmaşık problemlerde hatalı yanıtları azaltarak planlı bir süreç optimizasyonu sağlar.
Bu çalışma PaLM-540B modeli kullanılarak geliştirmiştir ve burada Wikipedia API, HotpotQA, FEVER, ALFWorld ve WebShop gibi araçları kullanarak test edilmiştir.
ReAct ve Chain-of-Thought yaklaşımların arasındaki sonuçlara göre ReAct, FEVER veri setinde CoT’den daha iyi performans gösterirken, HotpotQA’da CoT daha iyi performans sergilemiştir. Yazalar CoT’nin yüksek halüsinasyon oranına sahip olduğunu; ReAct’in ise harici verilere erişme sayesinde daha güvenilir çıktılar ürettiğini göstermektedir. Ancak ReAct’in yapılandırılmış araç döngüsü, araç hatalarına ve arama kalitesine bağımlılığa yol açmaktadır. Bu nedenle ReAct ve CoT’nin hibrit kullanımı (ReAct + CoT-SC), her iki yaklaşımı da tek başına aşan daha örnek-verimli ve güçlü bir çözüm sunmaktadır(Yao et al. 2022).
Daha güvenilir çıktılar ve daha az halüsinasyon oranına sahip olmasının yanında karmaşık görevlerde Context Window problemi, her adımda LLM için ek işlem gücü üretmesi ve araç hataları ve yanlış bilgi ile yanılış sonuç üretme riski oluşmaktadır.
Qin ve arkadaşlarının 2024 yılında yayınladıkları ToolLLM isimli çalışma 16000’dan fazla gerçek API kullanarak en kapsamlı araç öğrenimi çalışmasıdır. Bu çalışma araç seçimi aşamasında yanlış araç seçimi sorunlarını çözmek için "Depth-First Search-based Decision Tree" (DFSDT) yöntemini önermiştir. Bu yaklaşım, modelin olası çözüm yollarını bir ağaç yapısında keşfetmesini sağlayarak, geleneksel ReAct yöntemine göre başarı oranını artırmış ve keşif sürecini sistematize etmiştir. Her node bir API çağrısı, her edge bir sonraki seçim olarak düzenlenmiştir(Qin et al. 2023).
FireAct (Chen ve diğerleri, 2023) isimli çalışma, büyük ve pahalı modellerin araç kullanma yeteneklerini, daha küçük ve hızlı modeller kullanarak performans ve güvenirlik sorunlarını doğrudan fine-tuning ile öğrenilmesini önererek işlem maliyetini ve süresini ciddi oranda düşürür. Çalışma, genel kullanım yerine daha özelliştirilmiş amaçları yerine getirmek için eğitilmiş modelleri üretmektedir. Çalışma HotpotQA üzerinde ReAct ile kıyaslandığında daha iyi sonuçlar ürettiği gözlenmiştir. Ancak yazarlar, farklı veri seti formatlarından elde edilen, modelin bir görevi çözerken izlediği adımları (trajectory) nasıl en iyi şekilde birleştirileceğinin henüz net olmadığını ve bu tür yüksek kaliteli trajectory’lerin üretilmesinin maliyetli olduğunu belirtmektedir(Chen et al. 2023).
Schick vd. (2023) tarafından Meta AI Research çatısı altında yapılan ve yayınlanan çalışma LLM’lerin harici araçlar ile insan tarafından etiketlenmiş örneklere ihtiyaç duymadan kendi kendine öğrenebilmesini sağlayan "Toolformer adlı bir çerçeve önermektedir. Bu çalışma LLM’lerin Tool Calling mekanızmasını eğitim sürecine dahil eden çalışmalar için bir öncü niteliğindedir. Çalışmanın temel amacı, LLM’lerin kendi kendine Self-Supervised (denetimli) biçimde Tool Calling davranışı öğrenebileceğini göstermesidir ve işlem gücünü eğitilmiş veriler üzerinden yaparak maliyetleri azaltmasıdır. Çalışmadan elde edilen bulgulara göre bu yöntem gereksiz araç çağrılarından kaçınmayı öğrendiğini, yalnızca çıktının olasılığını gerçekten artıran çağrıları tercih ettiğini göstermektedir(Schick et al. 2023).
Şekil 4 gösterildiği gibi model cevap üretirken araç çağrıları için hazırladığı parametrelerden kendine soru-cevap benziri girdiler üreterek Self-Supervised öğrenimi sağlamaktadır.
Geliştirilen yöntem hesaplama işlemleri için Calculator aracı, arama işlemleri için Wikipedia Search API, çeviri işlemleri için Machine Translation API, tarhi-zaman işlemleri için Calendar API, çeviri işlemleri için Unit Conversion, genel soru-cevap işlemleri Question Answering API servislerini kullanarak deney ortamı oluşturulmuştur. Toolformer, araç gerektiren görevlerde, diğer modellere göre daha tutarlı ve anlamlı performans artışları sağlamıştır. Bu kazanımlar, modelin yalnızca araç çağırmayı öğrenmesinden değil, ne zaman çağırmaması gerektiğini de öğrenmesinden kaynaklanmaktadır
Ramirez ve arkadaşları tarafından 2024 yılında yayınlanan Cache & Distil: Optimising API Calls to Large Language Model isimli çalışma LLM’lerin gerçek Tool Calling mekanizmasının gerçek API servisleri ile çalıştıklarında oluşan maliyet ve veri gizliliği sorunları yarattığını vurgulayarak, bu maliyeti azaltmayı hedefleyen "Neural Caching" adlı bir sistem önermektedir(Ramı́rez et al. 2024). Yazarlar bu sorunu çözmek için iki farklı model oluşturulmasını önermektedir. Bu çalışma bu alanda öncü sayılabilecek Toolformer (Schick vd. 2023) çalışmasından etkilenmiştir. İlk model gerçek ve yüksek işlem gücüne sahip büyük dil model diğeri ise girdi ve çıktılar ile zamanlar eğitilmiş başka bir modeldir. İki model oluşması ile zamanla belirli girdiler LLM den daha küçük yapılı bir model ile çıktı üretebileceğini söylemektedir. Burada ki ana karakterler LLM bir öğretmen yeni oluşturulacak modelin bir öğrenci olarak nitelendirmektedirler. Bu şekilde belirli bir zaman sonra öğretmen-öğrenci ilişkisi ile LLM’den daha küçük bir modelin eğiltilerek "Neural Caching" (Sinirsel önbellekleme) mekanizmasının kurulabileceğini önermektedirler.
Çalışmanın temel problemi, hangi girdiler için LLM çağrısı yapılacağına ve hangilerinin öğrenci model tarafından yanıtlanacağına karar veren cevap seçme mekanizmasının tasarlanmasıdır. Yazarlar bu problemi, insan etiketleyici yerine LLM kullanılan Active Learning yöntemleri ile ele almaktadırlar.
Şekil 5 "Neural Caching" (Sinirsel önbellekleme) Bir öğrenci, kullanıcı talebine yanıt üretir. Sistem, öğrencinin yanıtına güvenilip güvenilmeyeceğine veya bir LLM çağrılıp çağrılmayacağına karar verir. LLM yanıtları saklanır ve daha fazla veri kullanılabilir hale geldikçe öğrenciyi yeniden eğitmek için kullanılır.
Kim vd. 2024 yılında yayınladıkları çalışma LLM’lerin Tool Calling yaklaşımlarındaki mevcut yöntemler (örneğin ReAct) bu çağrıları genellikle sıralı (sequential) bir şekilde ele aldıklarını vurgulamaktadır. Her bir araç çağrısı için ayrı bir işlem gerekmesi, yüksek gecikme süresine, artan maliyetlere ve hatalı davranışlara neden olmaktadır. Sıralı çalıştırma, ara adımların sonuçlarının modele tekrar tekrar verilmesiyle modelin dikkatini dağıtabilir ve doğruluğu düşürebilmektedir(Kim et al. 2023). Yazarlar, klasik derleyicilerin çalışma prensiplerinden ilham alarak, Tool Calling mekanızmasını paralel olarak yürüten ve yöneten LLMCompiler adlı bir mekanizma önermektedir.
Sistem üç ana bileşenden oluşur;
Function Calling Planner (Planlayıcı), Kullanıcı sorgusunu analiz eder ve görevler arasındaki bağımlılıkları belirleyerek bir görev dizisi ve bağımlılık grafiği (DAG - Directed Acyclic Graph) oluşturur.
Task Fetching Unit (Görev Alma Birimi), Görevleri dağıtır ve planlayıcı tarafından atanan yer verileri önceki görevlerin gerçek çıktılarıyla değiştirir.
Executor (Yürütücü), Bağımsız görevleri, ilgili araçları kullanarak paralel bir şekilde yürütür.
Şekil 6 Function Calling Planner, görevlerin birbirine bağımlılıklarıyla birlikte bir DAG (Directed Acyclic Graph) oluşturur. Bu görevler daha sonra Task Fetching Unit tarafından bağımlılıklarına göre paralel olarak Executor gönderilir. Bu örnekte, Görev $1 ve $2, iki bağımsız arama görevini paralel olarak yürütmek için birlikte alınır. Her görev tamamlandıktan sonra, sonuçlar Task Fetching Unit iletilir ve hesaplanması beklenen değişkenler gerçek değerlerle değiştirilerek bağımlı görevlerin engeli kaldırılır. Tüm görevler tamamlandıktan sonra, sonuç kullanıcıya iletilir.
Yazarlar HotpotQA, Movie Recommendation, ParallelQA, Game of 24 ve WebShop servis araçları ile bir deney ortamı oluşturarak ReAct ile karşılaştırıldığında 3.7 kata kadar gecikme süresi iyileştirmesi sağlandığını, Gereksiz tekrarlayan LLM çağrılarının önlenmesiyle 6.7 kata kadar maliyet düşüşü elde edildiğini ve halisinasyon hatalarının ortalama %9 azaldığını gözlemlemişlerdir. Ancak yazarlar paralel çalıştırılan görevlerden en yavaş olanı, toplam süreyi belirlediğini, bu da teorik hızlanmayı sınırladığından ve karmaşık görevlerde çok dallanmalar içeren problemlerde statik planlama yetersiz kalabileceğinden ve sürekli yeniden planlama gerektirebileceğinden dolayı işlem gücünü artabileceğini söylemektedirler.
Wang vd. (2025), LLM tabanlı sistemlerin belirsiz veya eksik kullanıcı talimatları altında araç kullanımı sırasında yaşadığı hataları incelemektedir. Yazarlar, mevcut tool-learning yaklaşımlarının kullanıcı talimatlarının her zaman açık olduğu varsayımına dayandığını ve bu nedenle gerçek dünya senaryolarında LLM’lerin eksik argümanları keyfi biçimde doldurarak (halüsinasyon) hatalı veya riskli API çağrıları üretebildiğini göstermektedir. Bu sorunu ele almak amacıyla, gerçek kullanıcı hatalarına dayalı NoisyToolBench adlı bir benchmark önerilmekte ve belirsiz talimatlar dört kategori altında; eksik bilgi, çoklu referans, hatalı bilgi ve araç yeteneklerini aşan talepler sınıflandırılmaktadır(Wang et al. 2025).
Çalışma Şekil 7 gösterildiği gibi, LLM belirsizlik tespit edildiğinde kullanıcıdan açıklama istemeye yönlendiren Ask-when-Needed (AwN) adlı bir mekanizma sunmaktadır. AwN, CoT ve ReAct gibi mevcut planlama tabanlı yöntemlerin üzerine inşa edilerek API çağrılarından önce açıklayıcı soru sorma mekanizmasını devreye sokmaktadır. Farklı LLM’ler üzerinde yapılan deneyler, AwN yaklaşımının hem doğru soru sorma hem de doğru araç çağrısı ve nihai çıktı üretimi açısından mevcut yöntemlere kıyasla anlamlı performans artışları sağladığını göstermektedir. Bu çalışma, belirsiz talimatlar altında güvenilir tool calling problemini sistematik biçimde ele alan ilk kapsamlı çalışmalardan biri olarak literatüre katkı sunmaktadır.
Tartışma
Bu çalışmada incelenen çalışmalar, LLM’lerin Tool Calling mekanizmasının saddece bir yazılım sorunu olmadığının, bunun yanında detaylı ve farklı optimizasyon ve karar verme problemi olarak ele alınması gerektiğini açık biçimde ortaya koymaktadır. Tool Calling yeteneği, LLM’lerin kendi bilgi sınırlarını aşarak dinamik, güncel ve hesaplamaya dayalı görevleri yerine getirmesini mümkün kılarken; bu kazanımlar yanı sıra doğruluk, gecikme, maliyet, performans ve güvenilirlik gibi temel zorlukları da beraberinde getirmektedir.
Doğruluk ve Akıl Yürütme; Tool Calling ReAct, ToolLLM ve FireAct çalışmaları bu alanda öncü olarak, Tool Calling’in akıl yürütme süreçleriyle sıkı biçimde bağlantılı olduğunu göstermektedir. Özellikle ReAct yaklaşımı, düşünme (reasoning) ve eylem (acting) adımlarını ardışık biçimde birleştirerek çok adımlı görevlerde doğruluğu artırmayı hedeflemektedir. Ancak bu yapı, her akıl yürütme adımının yeni bir Tool Calling çağrısını tetiklemesi nedeniyle maliyet sorunları, context window sorunları, yüksek gecikme, hata riski ve halüsinasyon gibi sorunlara yol açabilmektedir.
ToolLLM tarafından önerilen DFSDT yaklaşımı, araç seçimini bir arama problemi olarak ele alarak yanlış araç seçimi olasılığını azaltmaktadır. Bu durum, Tool Calling’in yalnızca hangi aracın çağrılacağı değil, aynı zamanda hangi sırayla ve hata durumunda hangi alternatiflerle çağrılacağı sorunlarını çözümünü göstermektedir. Ancak bu tür yöntemlerin hesaplama karmaşıklığı, ölçeklenebilirlik ve performans açısından önemli bir soru işaretleri öne çıkarmaktadır.
Maliyet ve Gecikme; Tool Calling’in LLM tabanlı sistemlerde token tüketimini ve API çağrı maliyetlerini önemli ölçüde artırdığıdır. Özellikle sıralı (sequential) araç çağırma yaklaşımlarında, her adımın bir öncekinin çıktısına bağımlı olması gecikmeyi doğrusal biçimde artırmaktadır. LLMCompiler çalışması bu noktada önemli bir kırılma sunarak, klasik derleyici prensiplerinden ilham alan paralel Tool Calling mimarisinin gecikme ve maliyet üzerinde ciddi iyileştirmeler sağlayabileceğini göstermiştir ancak paralel çağrı yaklaşımlarının teorik hızlanması pratikte en yavaş görev tarafından sınırlandırılmaktadır. Ayrıca görevler arası bağımlılıkların olduğu senaryolarda, planlamanın yetersiz kalabileceği ve yeniden planlama maliyetlerinin artabileceği görülmektedir.
Öğrenme ve Önbellekme; Toolformer ve Cache & Distil çalışmaları, Tool Calling optimizasyonunun sadece çalışma anında öğrenme sürecinde de ele alınması gerektiğini ortaya koymaktadır. Toolformer’ın Self-Supervised yöntemi ile, modelin yalnızca araç kullanmayı değil, aynı zamanda ne zaman araç kullanmaması gerektiğini öğrenmesini sağlayarak gereksiz çağrıları azaltmaktadır. Cache & Distil yaklaşımı ise öğretmen-öğrenci mimarisi üzerinden, sık tekrar eden Tool Calling senaryolarının daha küçük modeller veya önbellek mekanizmalarıyla ele alınabileceğini göstermektedir. Bu yaklaşım, uzun vadede maliyetleri düşürme potansiyeli taşımakla birlikte, hangi girdilerin güvenle önbelleğe alınabileceğini belirleyen karar mekanizmasının tasarımını kritik hale getirmektedir.
Güvenilirlik, Hata Toleransı; Tool Calling mekanizmasının yaygınlaşması, LLM tabanlı sistemlerde hata yüzeyini de genişletmektedir. Ağ hataları, zaman aşımı, beklenmeyen API çıktıları veya şema uyumsuzlukları, çok adımlı görevlerde tüm sürecin başarısız olmasına yol açabilmektedir. İncelenen çalışmalarda bu sorunun standartlaşmış hata tolerans mekanizmalarının henüz yeterince gelişmediği gösterilmektedir. Bu durum, Tool Calling optimizasyonunun yalnızca performans ve maliyet ekseninde değil, güvenlik ve yönetişim boyutlarıyla birlikte değerlendirilmesi gerektiğini göstermektedir.
Bu çalışmada incelenen çalışmalar değerlendirildiğinde, Tool Calling optimizasyonunun tek bir yöntemle çözülebilecek bir sorun olmadığı daha karmaşık sorunların ve detaylı analizlere ihtiyaç duyulduğu görülmektedir. Akıl yürütme tabanlı yöntemler doğruluğu artırırken maliyeti yükseltmekte; paralel ve önbellek temelli yaklaşımlar maliyeti düşürürken esneklik ve genelleme sorunları doğurabilmektedir. Gelecek çalışmalar, modelin yalnızca doğru aracı çağırmayı değil, aynı zamanda gereksiz araç çağrılarını engellemeyi de öğrenebildiği maliyet-performans ve optimizasyon odaklı mekanizmaların üzerine yoğunlaşabielceğini göstermektedir.
Sonuç
Bu çalışmada, LLM’lerde Tool Calling mekanizması doğruluk, maliyet, gecikme ve güvenilirlik boyutlarıyla incelenerek öne sunulmuştur. İncelenen çalışmalar, Tool Calling’in LLM’lerin yeteneklerini sadece soru-cevap metin üretiminin sınırlarını aşarak harici bilgi kaynakları ve sistemlerle etkileşim kurabilen sistemlere dönüşümünde kritik bir rol oynadığını göstermektedir. Ancak bu dönüşüm, yanlış araç seçimi, planlama kaynaklı gecikmeler, token tüketimi, hata riskleri ve halüsinasyon gibi önemli optimizasyon problemlerini de beraberinde getirmektedir.
Literatürde önerilen ReAct, ToolLLM, Toolformer, LLMCompiler ve Cache & Distil gibi yaklaşımlar, bu problemlerin farklı yönlerine çözüm üretse de, genel olarak bir yöntemin tüm gereksinimleri aynı anda karşılayamadığı görülmektedir. Bu durum, Tool Calling’in tek başına bir model özelliği değil; planlama, öğrenme, sistem tasarımı ve maliyet yönetimini genel anlamda içine alan optimizasyon problemi olduğunu ortaya koymaktadır.
Sonuç olarak, Tool Calling optimizasyonu akademik araştırmalar ile
gerçek dünya uygulamaları arasında güçlü bir köprü kurma potansiyeline
sahiptir. Bu alanda yapılacak disiplinler arası çalışmalar, LLM tabanlı
sistemlerin daha ölçeklenebilir, ekonomik ve güvenli bir şekilde gerçek
dünya problemlerinde kullanılmasını sağlayacaktır.
- Besta, Maciej, Nils Blach, Ales Kubicek, Robert Gerstenberger, Michal Podstawski, Lukas Gianinazzi, Joanna Gajda, et al. 2024. “Graph of Thoughts: Solving Elaborate Problems with Large Language Models.” Proceedings of the AAAI Conference on Artificial Intelligence 38 (16): 17682–90. https://doi.org/10.1609/aaai.v38i16.29720.
- Chen, Baian, Chang Shu, Ehsan Shareghi, Nigel Collier, Karthik Narasimhan, and Shunyu Yao. 2023. “Fireact: Toward Language Agent Fine-Tuning.” arXiv Preprint arXiv:2310.05915.
- Ding, Zihao, Mufeng Zhu, and Yao Liu. 2025. “Network and Systems Performance Characterization of MCP-Enabled LLM Agents.” https://arxiv.org/abs/2511.07426.
- Fan, Lizhou, Lingyao Li, Zihui Ma, Sanggyu Lee, Huizi Yu, and Libby Hemphill. 2023. “A Bibliometric Review of Large Language Models Research from 2017 to 2023.” https://arxiv.org/abs/2304.02020.
- Kim, Sehoon, Suhong Moon, Ryan Tabrizi, Nicholas Lee, Michael W Mahoney, Kurt Keutzer, and Amir Gholami. 2023. “An LLM Compiler for Parallel Function Calling. arXiv.” arXiv Preprint arXiv:2312.04511.
- Qian, Cheng, Chi Han, Yi Fung, Yujia Qin, Zhiyuan Liu, and Heng Ji. 2023. “Creator: Tool Creation for Disentangling Abstract and Concrete Reasoning of Large Language Models.” In Findings of the Association for Computational Linguistics: EMNLP 2023, 6922–39.
- Qin, Yujia, Shihao Liang, Yining Ye, Kunlun Zhu, Lan Yan, Yaxi Lu, Yankai Lin, et al. 2023. “Toolllm: Facilitating Large Language Models to Master 16000+ Real-World Apis, 2023.” URL Https://Arxiv. Org/Abs/2307.16789.
- Ramı́rez, Guillem, Matthias Lindemann, Alexandra Birch, and Ivan Titov. 2024. “Cache & Distil: Optimising Api Calls to Large Language Models.” In Findings of the Association for Computational Linguistics: ACL 2024, 11838–53.
- Schick, Timo, Jane Dwivedi-Yu, Roberto Dessı̀, Roberta Raileanu, Maria Lomeli, Eric Hambro, Luke Zettlemoyer, Nicola Cancedda, and Thomas Scialom. 2023. “Toolformer: Language Models Can Teach Themselves to Use Tools.” Advances in Neural Information Processing Systems 36: 68539–51.
- Wang, Wenxuan, Shi Juluan, Zixuan Ling, Yuk-Kit Chan, Chaozheng Wang, Cheryl Lee, Youliang Yuan, Jen-tse Huang, Wenxiang Jiao, and Michael R Lyu. 2025. “Learning to Ask: When Llm Agents Meet Unclear Instruction.” In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, 21784–95.
- Xu, Binfeng, Zhiyuan Peng, Bowen Lei, Subhabrata Mukherjee, Yuchen Liu, and Dongkuan Xu. 2023. “ReWOO: Decoupling Reasoning from Observations for Efficient Augmented Language Models.” https://arxiv.org/abs/2305.18323.
- Yao, Shunyu, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik R Narasimhan, and Yuan Cao. 2022. “React: Synergizing Reasoning and Acting in Language Models.” In The Eleventh International Conference on Learning Representations.
