FA
API & MCPمستندات

پلتفرم عامل‌ها و API Mariner GPS Tools

روش‌شناسی و نتایج بنچمارک

ببینید Mariner GPS Tools چه تأثیری بر مصرف توکن مدل، زمان پاسخ و دقت در 9 مدل هوش مصنوعی دارد و ما نتایج را چگونه اندازه‌گیری کرده‌ایم.

بنچمارک چه چیزی را می‌سنجد

ما همان وظایف ناوبری را با Mariner GPS Tools و بدون آن مقایسه می‌کنیم تا تأثیر آن بر توکن‌های تولیدشدهٔ مدل، زمان پاسخ و دقت را بسنجیم. هر وظیفه از مدل، پرامپت و تنظیمات یکسان استفاده می‌کند و تنها تفاوت، در دسترس بودن ابزارهای MCP است.

نتایج اصلی

84%توکن تولیدشدهٔ کمتر توسط مدلمیانه در 9 مدل آزموده‌شده.
100%پاسخ درست با MCP594/594 مشاهده با MCP عملیاتی در محدودهٔ رواداری.
91.6%پاسخ درست بدون MCP594 مشاهده که مدل به‌تنهایی به آن‌ها پاسخ داد.

اندازه‌گیری‌شده در 1405 شهریور · 9 مدل · 22 مورد ناوبری · 3 تکرار · 1188 مشاهده · MCP عملیاتی Mariner GPS Tools

نتایج بر اساس ردهٔ مدل

هر رقم میانهٔ سه مدل آن رده است. رده‌ها از جایگاهی پیروی می‌کنند که هر ارائه‌دهنده خود برای مدل تعیین کرده است و پیش از دیدن نتایج تثبیت شده‌اند.

کاهش توکن‌های تولیدشده
کوچک / کم‌مصرف94.1%
همه‌منظوره93.0%
پیشرفته78.4%
میانهٔ کلی84%
پاسخ‌های درست
خط پایهٔ LLM91.6% (544/594)
LLM + MCP100% (594/594)

نتایج بر اساس ابزار

این مجموعه هر پنج محاسبه‌گر را در 22 مورد پوشش می‌دهد، از مسیرهای کوتاه ساحلی تا گذرهای اقیانوسی، از جمله مسیرهای گذرنده از نصف‌النهار 180 درجه، مسیرهای نیم‌کرهٔ جنوبی و مسیرهای عرض‌های جغرافیایی بالا. رقم تنها در جایی منتشر می‌شود که همهٔ مدل‌های واجد شرایط سود برده باشند.

این جدول مشاهده‌های قابل‌استفادهٔ هر ابزار را یک‌جا تجمیع می‌کند: فقط پاسخ‌های درست، مانند همهٔ مقایسه‌های توکن و زمان پاسخ. صفحه‌های ابزارها میانه را در مدل‌های واجد شرایط ذکر می‌کنند، یعنی همان رقمی که بنچمارک برای هر ابزار منتشر می‌کند، بنابراین این دو ممکن است اندکی با هم تفاوت داشته باشند.

ابزارتوکن‌های تولیدشدهافزایش سرعتپاسخ‌های درست: خط پایهٔ LLM, LLM + MCP
محاسبهٔ سمت حقیقی اولیه‎−91.6%5.1×خط پایهٔ LLM: 101/108, LLM + MCP: 108/108
محاسبهٔ فاصلهٔ دایرهٔ عظیمه‎−91.0%4.4×خط پایهٔ LLM: 94/108, LLM + MCP: 108/108
محاسبهٔ خطای عرضی مسیر (XTE)‎−94.5%9.8×خط پایهٔ LLM: 106/135, LLM + MCP: 135/135
خواندن و قالب‌بندی مختصاتمنتشر نشده‎+7.1%2.9× کندترخط پایهٔ LLM: 108/108, LLM + MCP: 108/108

مدل‌ها این کار را به‌تنهایی و به‌طور مؤثر انجام دادند. در این آزمایش‌های مستقل تبدیل، استفاده از ابزار سربار بیشتری نسبت به صرفه‌جویی حاصل از آن ایجاد کرد.

تبدیل سرعت‌هامنتشر نشده‎+33.0%4.1× کندترخط پایهٔ LLM: 135/135, LLM + MCP: 135/135

مدل‌ها این کار را به‌تنهایی و به‌طور مؤثر انجام دادند. در این آزمایش‌های مستقل تبدیل، استفاده از ابزار سربار بیشتری نسبت به صرفه‌جویی حاصل از آن ایجاد کرد.

چرا نتایج از ابزاری به ابزار دیگر فرق می‌کند

استفاده از یک ابزار MCP به هر درخواست کمی سربار می‌افزاید. در محاسبات پیچیده‌تر مانند جهت، فاصله و خطای عرضی مسیر، این سربار با کار بسیار کمتری که خودِ مدل انجام می‌دهد جبران می‌شود. در آزمایش‌های ما، این ابزارها کاهش چشمگیری در توکن‌های تولیدشده و زمان پاسخ به دست آوردند و در عین حال دقت 100% را حفظ کردند.

برای کارهای ساده‌تر مانند تبدیل واحد و مختصات، مدل‌ها اغلب می‌توانند پاسخ را به‌سرعت و بدون ابزار محاسبه کنند. در این بنچمارک، استفاده از ابزار برای این کارها برای همه مدل‌های آزمایش‌شده زمان بیشتری برد و در مجموع توکن‌های بیشتری مصرف کرد.

در میان 9 مدل آزمایش‌شده، کاهش توکن‌های تولیدشده از 7.3% تا 95.4% متغیر بود و عملکرد سرتاسری نسبت به خط پایه از 0.6× تا 5.8× بود.

توکن‌های تولیدشده و کل توکن‌ها

توکن‌های تولیدشده همان توکن‌های خروجی مدل هستند، با احتساب استدلال. این معیار اصلی است، زیرا همان کاری است که ابزار جایگزین آن می‌شود.

روش‌شناسی و بررسی‌های درستی

  • آزمون خط پایه و آزمون MCP از پرامپت، وظیفه، مدل و تنظیمات یکسان استفاده می‌کنند. تنها تفاوت این است که Mariner GPS Tools به درخواست متصل باشد یا نه.
  • به مدل‌ها گفته نمی‌شود که از ابزارها استفاده کنند. خودشان تصمیم می‌گیرند که آن‌ها را فراخوانی کنند یا نه.
  • ارقام توکن مستقیماً از هر ارائه‌دهندهٔ مدل گرفته می‌شود. ارقام MCP تعریف ابزارها و هر نوبت مدل را که در استفاده از یک ابزار دخیل است در بر می‌گیرد.
  • پاسخ‌ها در برابر مقادیر مورد انتظارِ مستقلاً محاسبه‌شده و رواداری‌های ثابت بررسی می‌شوند. برای داوری درستی از هیچ LLM استفاده نمی‌شود.
  • مقایسه توکن‌ها و زمان پاسخ بر اساس پاسخ‌های صحیح انجام می‌شود. پاسخ‌های نادرست و خطاهای مدل یا ابزار همچنان در نتایج دقت محاسبه می‌شوند، از جمله مواردی که مدل از انجام کار خودداری کرده است. اجراهایی که به دلایل زیرساختی، مانند قطعی سرویس ارائه‌دهنده، ناموفق بودند دوباره اجرا شدند و اجراهای ناموفق اولیه کنار گذاشته شدند.
  • همهٔ فراخوانی‌های ابزار از نقطهٔ پایانی عملیاتی MCP در Mariner GPS Tools استفاده می‌کنند و زمان شبکه و رفت‌وبرگشت‌های MCP در زمان‌های پاسخ لحاظ شده است.
  • هر مورد برای هر مدل و هر وضعیت 3 بار اجرا می‌شود. ارقام گزارش‌شده میانه‌اند، نه بهترین اجراهای گزینش‌شده.

بازتولیدپذیری

تاریخ بنچمارک29 شهریور 1405
برنامهٔ بنچمارکwn-mcp-bench 0.1.0 (40436f25ed54)
مجموعهmariner-tools v0.2.0
هش مجموعه (SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
نقطهٔ پایانی MCPhttps://marinergps.tools/mcp
سرور MCPmariner-tools 1.0.0 · MCP 2025-11-25
میزان تلاش استدلالیmedium
اجراe8d9d909-831b-4e5e-91aa-cf1413c81096
پرامپت سیستم، در هر دو وضعیتtext
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
مستندات API و MCP