TPU چیست؟ آشنایی با معماری، عملکرد و کاربردهای پردازنده هوش مصنوعی گوگل

TPU چیست و چرا به یکی از مهمترین شتابدهندههای سختافزاری هوش مصنوعی تبدیل شده است؟ TPU یا Tensor Processing Unit، پردازندهای تخصصی است که برای اجرای سریع و بهینه عملیات Tensor و محاسبات ماتریسی در مدلهای یادگیری ماشین طراحی شده است. این فناوری با معماری متفاوت خود، رویکردی تخصصیتر نسبت به CPU و GPU در پردازش Workloadهای هوش مصنوعی ارائه میدهد. در این مقاله، ابتدا با مفهوم TPU و نحوه عملکرد آن آشنا میشویم و سپس معماری Systolic Array، نسلهای مختلف TPU و نقش آن در Training و Inference مدلهای هوش مصنوعی را بررسی میکنیم. همچنین تفاوت TPU و GPU، کاربردهای TPU در مدلهای زبانی و Generative AI، مزایا و محدودیتهای آن و نقش Cloud TPU در زیرساختهای مدرن AI را بررسی خواهیم کرد تا جایگاه این شتابدهنده در آینده محاسبات هوش مصنوعی روشن شود.
TPU چیست و چرا برای هوش مصنوعی ساخته شد؟
TPU مخفف Tensor Processing Unit است. این پردازنده، یک مدار مجتمع با کاربرد اختصاصی یا ASIC محسوب میشود. گوگل TPU را برای تسریع عملیات یادگیری ماشین طراحی کرد. این معماری بهویژه روی محاسبات Tensor و عملیات ماتریسی تمرکز دارد. مدلهای یادگیری عمیق بخش بزرگی از محاسبات خود را با ضرب ماتریسها انجام میدهند. این عملیات در شبکههای عصبی، لایههای مختلف و مدلهای ترنسفورمر تکرار میشود.
پردازندههای عمومی، انعطافپذیری بالایی دارند. بااینحال، این انعطافپذیری همیشه به بیشترین بهرهوری برای یک Workload مشخص منجر نمیشود. TPU مسیر متفاوتی را انتخاب میکند. این پردازنده بسیاری از منابع سختافزاری خود را برای عملیات موردنیاز مدلهای یادگیری ماشین اختصاص میدهد. بنابراین، TPU را میتوان نمونهای از حرکت صنعت به سمت محاسبات دامنهمحور دانست. در این رویکرد، معماری سختافزار با نیازهای یک حوزه مشخص هماهنگ میشود.

چرا Tensor اهمیت دارد؟
Tensor در سادهترین تعریف، ساختاری چندبعدی برای نمایش دادههای عددی است. شبکههای عصبی تقریباً تمام دادههای خود را به شکل Tensor پردازش میکنند. تصاویر، وزنهای مدل، فعالسازیها و بسیاری از دادههای میانی، همگی میتوانند به شکل Tensor نمایش داده شوند. بنابراین، هرچه مدل بزرگتر شود، تعداد عملیات Tensor نیز افزایش پیدا میکند. TPU با تمرکز روی همین عملیات، بخش مهمی از بار محاسباتی مدل را شتاب میدهد.
TPU چگونه کار میکند؟
برای درک TPU باید ابتدا به نوع محاسبات مدلهای یادگیری عمیق توجه کنیم. فرض کنید یک شبکه عصبی باید دو ماتریس بزرگ را در یکدیگر ضرب کند. این عملیات، تعداد بسیار زیادی ضرب و جمع مستقل ایجاد میکند. پردازنده میتواند این عملیات را بهصورت موازی اجرا کند. هرچه موازیسازی بیشتر باشد، سختافزار میتواند عملیات بیشتری را در مدت مشخص انجام دهد.
TPU این ایده را در سطح معماری دنبال میکند. یکی از مهمترین اجزای معماری TPU، Matrix Multiply Unit یا MXU است. MXU عملیات ضرب ماتریسی را با تعداد زیادی واحد محاسباتی انجام میدهد. این ساختار برای اجرای محاسبات متراکم شبکههای عصبی بسیار مناسب است.
معماری Systolic Array
یکی از مفاهیم کلیدی در معماری TPU، Systolic Array است. در این معماری، دادهها از میان مجموعهای از عناصر محاسباتی عبور میکنند. هر عنصر بخشی از عملیات ضرب و جمع را انجام میدهد. دادهها بهصورت منظم میان این عناصر حرکت میکنند. این روش میتواند نیاز به رفتوبرگشت مداوم داده میان حافظه و واحد محاسباتی را کاهش دهد. این ویژگی اهمیت زیادی دارد. در بسیاری از سیستمهای مدرن، انتقال داده میتواند بهاندازه خود محاسبات هزینهبر باشد.
بنابراین، TPU فقط به افزایش تعداد عملیات محاسباتی توجه نمیکند. معماری آن تلاش میکند جریان داده را نیز برای Workloadهای هوش مصنوعی بهینه کند.
معماری TPU چه تفاوتی با CPU و GPU دارد؟
CPU برای اجرای طیف بسیار گستردهای از نرمافزارها طراحی شده است. این پردازنده معمولاً تعداد محدودی هسته قدرتمند و انعطافپذیر دارد. GPU رویکرد متفاوتی اتخاذ میکند. این پردازنده تعداد زیادی هسته محاسباتی را برای اجرای موازی عملیات در اختیار برنامه قرار میدهد. TPU حتی تخصصیتر عمل میکند. این پردازنده منابع بیشتری را به الگوهای محاسباتی رایج در یادگیری ماشین اختصاص میدهد.
سایت رصدخانه قبلا در مقاله ای به GPU و نقش آن در هوش مصنوعی پرداخته بود.
به بیان ساده، میتوان این سه معماری را چنین تصور کرد:
| ویژگی | CPU | GPU | TPU |
|---|---|---|---|
| هدف اصلی | محاسبات عمومی | پردازش موازی | محاسبات AI |
| انعطافپذیری | بسیار بالا | بالا | محدودتر |
| Parallelism | متوسط | بسیار بالا | بسیار بالا |
| عملیات ماتریسی | مناسب | بسیار مناسب | بسیار بهینه |
| کاربرد عمومی | عالی | خوب | محدود |
| بهینهسازی AI | محدود | بالا | بسیار بالا |
البته این جدول یک مقایسه مفهومی است. عملکرد واقعی به نسل سختافزار، مدل، نرمافزار و نوع Workload وابسته است.
نسلهای مختلف TPU؛ از TPU v1 تا نسلهای جدید
گوگل نخستین TPU را با تمرکز ویژه بر Inference معرفی کرد. این نسل برای اجرای مدلهای یادگیری ماشین در مقیاس بالا طراحی شده بود. TPUهای بعدی قابلیتهای بیشتری برای Training ارائه کردند. همین تغییر، نقش TPU را از یک شتابدهنده استنتاج به یک پلتفرم کاملتر برای AI توسعه داد.
TPU v1؛ تمرکز بر استنتاج
نسل اول TPU در سال ۲۰۱۶ معرفی شد. این تراشه بیشتر برای اجرای مدلهای آموزشدیده طراحی شده بود. گوگل از آن برای برخی سرویسهای داخلی خود استفاده کرد. هدف اصلی، اجرای سریعتر مدلها با بهرهوری مناسب بود. این نسل اهمیت یک ایده را نشان داد: میتوان سختافزاری را مستقیماً برای Workloadهای یادگیری ماشین طراحی کرد.
TPU v2؛ ورود جدی به Training
TPU v2 مسیر توسعه را تغییر داد. این نسل علاوه بر Inference، برای آموزش مدلهای یادگیری ماشین نیز طراحی شد. افزایش توان محاسباتی و حافظه، امکان اجرای Workloadهای سنگینتر را فراهم کرد. همچنین گوگل امکان استفاده ابری از TPU را توسعه داد.
TPU v3؛ افزایش مقیاس
TPU v3 توان محاسباتی بیشتری نسبت به نسل قبلی ارائه کرد. گوگل همچنین از خنکسازی مایع برای مدیریت گرمای سیستمهای TPU استفاده کرد. این نسل اهمیت مقیاسپذیری را بیشتر نشان داد. مدلهای بزرگتر به مجموعههای بزرگتری از شتابدهندهها نیاز داشتند.
TPU v4؛ حرکت به سمت سیستمهای بزرگ AI
TPU v4 گام مهم دیگری در مسیر مقیاسپذیری بود. گوگل این نسل را برای Training و Inference در مقیاس بالا توسعه داد. در این مرحله، TPU دیگر فقط یک تراشه منفرد نبود. شبکهای از شتابدهندهها، حافظه و ارتباطات پرسرعت، یک سیستم محاسباتی یکپارچه ایجاد میکرد.
نسلهای جدید TPU
گوگل پس از TPU v4 نیز نسلهای جدیدتری را توسعه داد. TPU v5e و TPU v5p برای نیازهای متفاوت AI طراحی شدند. v5e بیشتر روی بهرهوری و هزینه برای Workloadهای متنوع تمرکز دارد. v5p نیز توان بالاتر و مقیاسپذیری بیشتری برای Training ارائه میکند. این روند نشان میدهد که TPU به یک خانواده کامل از شتابدهندههای AI تبدیل شده است.
TPU در آموزش و استنتاج مدلهای هوش مصنوعی
دو مرحله مهم در چرخه عمر مدلهای AI، Training و Inference هستند.
در Training، مدل بارها دادهها را پردازش میکند. سپس سیستم وزنهای مدل را برای کاهش خطا تغییر میدهد. این فرآیند به میلیاردها یا حتی تریلیونها عملیات محاسباتی نیاز دارد. بنابراین، سرعت پردازش و ارتباط میان شتابدهندهها اهمیت زیادی پیدا میکند. Inference مرحله استفاده از مدل آموزشدیده است. در این مرحله، سیستم ورودی را دریافت میکند و خروجی مدل را تولید میکند. TPU میتواند در هر دو مرحله نقش داشته باشد. نوع TPU و پیکربندی سیستم، میزان مناسببودن آن برای هر Workload را تعیین میکند.
چرا TPU برای مدلهای بزرگ مناسب است؟
مدلهای بزرگ معمولاً به بیش از یک شتابدهنده نیاز دارند. بنابراین، اتصال سریع میان شتابدهندهها اهمیت زیادی پیدا میکند. گوگل برای TPU شبکههای ارتباطی تخصصی توسعه داده است. این شبکهها امکان اتصال تعداد زیادی TPU را در قالب یک سیستم بزرگ فراهم میکنند. در نتیجه، مدل میتواند محاسبات خود را میان تعداد زیادی شتابدهنده توزیع کند. این رویکرد برای Training مدلهای بزرگ اهمیت حیاتی دارد.
TPU در برابر GPU؛ کدامیک برای AI بهتر است؟
پاسخ سادهای برای این پرسش وجود ندارد. انتخاب میان TPU و GPU به نوع مدل، نرمافزار، مقیاس و هدف پروژه بستگی دارد. GPU انعطافپذیری بسیار بالایی دارد. اکوسیستم CUDA و کتابخانههای گسترده NVIDIA نیز توسعه بسیاری از مدلهای AI را آسانتر کردهاند. TPU در مقابل، تخصصیتر است. این معماری برای عملیات Tensor و Workloadهای یادگیری ماشین بهینه شده است.
عملکرد
در Workloadهای مناسب، TPU میتواند Throughput بالایی ارائه کند. بااینحال، هیچ شتابدهندهای برای تمام مدلها بهترین انتخاب نیست. ساختار مدل، اندازه Batch، دقت عددی، الگوی دسترسی به حافظه و نرمافزار میتوانند نتیجه را تغییر دهند.
انعطافپذیری
GPU معمولاً گزینه انعطافپذیرتری برای توسعهدهندگان است. برنامهنویس میتواند طیف گستردهای از الگوریتمها را روی آن اجرا کند. TPU محدودیتهای بیشتری دارد. بنابراین، مدل باید با معماری و ابزارهای نرمافزاری TPU سازگاری مناسبی داشته باشد.
هزینه و بهرهوری
در مقیاس بزرگ، هزینه انرژی و زیرساخت اهمیت زیادی پیدا میکند. TPU میتواند برای Workloadهای مناسب، بهرهوری محاسباتی مطلوبی ارائه دهد. بااینحال، هزینه واقعی فقط به قیمت تراشه وابسته نیست. نرمافزار، توسعه، شبکه، حافظه و مدیریت زیرساخت نیز باید در محاسبه هزینه لحاظ شوند.
TPU چه کاربردهایی دارد؟
TPU برای طیف گستردهای از Workloadهای هوش مصنوعی استفاده میشود.
مدلهای زبانی بزرگ
مدلهای زبانی بزرگ به عملیات ماتریسی عظیمی نیاز دارند. این مدلها همچنین به Training توزیعشده و ارتباط سریع میان شتابدهندهها نیازمند هستند. TPU میتواند بخش بزرگی از این محاسبات را اجرا کند. گوگل از TPU در توسعه و اجرای مدلهای هوش مصنوعی خود استفاده کرده است.
بینایی ماشین
مدلهای Computer Vision نیز به عملیات Tensor متکی هستند. شبکههای کانولوشنی و مدلهای جدیدتر Vision Transformer نمونههایی از این Workloadها هستند. TPU میتواند عملیات محاسباتی این مدلها را در مقیاس بالا شتاب دهد.
سیستمهای توصیهگر
Recommendation Systemها حجم زیادی از داده را پردازش میکنند. این سیستمها در سرویسهای بزرگ دیجیتال اهمیت زیادی دارند. گوگل از شتابدهندههای تخصصی برای بهینهسازی بخشی از چنین Workloadهایی استفاده کرده است.
پردازش زبان طبیعی
مدلهای NLP از جمله مدلهای مبتنی بر Transformer به محاسبات ماتریسی گسترده نیاز دارند. به همین دلیل، معماریهای شتابدهندهای مانند TPU میتوانند برای این Workloadها مناسب باشند.
TPU و Google Cloud؛ دسترسی به شتابدهندههای هوش مصنوعی
یکی از نقاط قوت TPU، امکان دسترسی به آن از طریق زیرساخت ابری گوگل است. Cloud TPU به کاربران اجازه میدهد بدون خرید و مدیریت مستقیم سختافزار، از ظرفیت پردازشی TPU استفاده کنند. این مدل دسترسی برای شرکتهایی اهمیت دارد که به توان محاسباتی بالا نیاز دارند. خرید یک زیرساخت عظیم AI برای بسیاری از سازمانها اقتصادی نیست.
کاربر میتواند منابع موردنیاز خود را در محیط ابری دریافت کند. سپس مدل را روی TPU اجرا یا آموزش دهد. اکوسیستم نرمافزاری نیز نقش مهمی دارد. TensorFlow و JAX از جمله فناوریهایی هستند که با زیرساخت TPU ارتباط نزدیکی دارند. این موضوع نشان میدهد که TPU فقط یک قطعه سختافزاری نیست. سختافزار، نرمافزار، شبکه و زیرساخت ابری، مجموعهای یکپارچه تشکیل میدهند.
مزایا و محدودیتهای TPU
مهمترین مزایای TPU
یکی از مهمترین مزایای TPU، تخصصیبودن آن است. معماری TPU بسیاری از منابع خود را برای عملیات رایج در یادگیری ماشین اختصاص میدهد. Throughput بالا نیز یکی دیگر از مزیتهای مهم است. TPU میتواند حجم زیادی از عملیات Tensor را بهصورت موازی اجرا کند. مقیاسپذیری نیز اهمیت زیادی دارد. چندین TPU میتوانند در قالب یک سیستم بزرگتر با یکدیگر کار کنند. بهرهوری انرژی نیز در طراحی شتابدهندههای تخصصی اهمیت دارد. حذف برخی قابلیتهای عمومی میتواند منابع سختافزاری را برای هدف مشخصتری آزاد کند.
مهمترین محدودیتهای TPU
TPU انعطافپذیری کمتری نسبت به پردازندههای عمومی دارد. بنابراین، هر الگوریتمی الزاماً بهترین عملکرد را روی TPU ارائه نمیدهد. وابستگی به اکوسیستم نرمافزاری نیز اهمیت دارد. توسعهدهنده باید ابزارها و فریمورکهای سازگار با TPU را بهدرستی انتخاب کند. مهاجرت برخی پروژههای موجود از GPU به TPU نیز میتواند به تغییرات نرمافزاری نیاز داشته باشد. بنابراین، انتخاب TPU باید بر اساس Workload واقعی انجام شود. صرفاً داشتن توان محاسباتی بیشتر، به معنی عملکرد بهتر برای هر پروژه نیست.
TPU در عصر مدلهای مولد و هوش مصنوعی عاملمحور
ظهور Generative AI اهمیت شتابدهندههای تخصصی را بیشتر کرده است. مدلهای مولد امروزی به حجم عظیمی از محاسبات نیاز دارند. مدلهای زبانی، تصویری و چندوجهی، تعداد بسیار زیادی پارامتر را پردازش میکنند. در چنین شرایطی، فقط قدرت یک تراشه اهمیت ندارد. سیستم باید بتواند هزاران شتابدهنده را بهصورت هماهنگ مدیریت کند. این مسئله، شبکه و ارتباط میان شتابدهندهها را به یکی از عناصر کلیدی زیرساخت AI تبدیل کرده است.
Agentic AI نیز این روند را تشدید میکند. عاملهای هوشمند میتوانند بهطور مداوم مدلهای مختلف را فراخوانی کنند و چندین مرحله پردازشی انجام دهند. در نتیجه، صنعت به سمت معماریهایی حرکت میکند که محاسبات، حافظه و ارتباطات را بهصورت یکپارچهتر طراحی میکنند. TPU نمونه مهمی از همین تحول است. این فناوری نشان میدهد که آینده AI فقط به مدلهای بهتر وابسته نیست. سختافزار مناسب نیز بخشی از معماری هوش مصنوعی آینده خواهد بود.
آینده TPU و شتابدهندههای اختصاصی هوش مصنوعی
رقابت میان شتابدهندههای AI دیگر فقط رقابت میان تراشهها نیست. شرکتها اکنون تلاش میکنند کل پشته فناوری را بهینه کنند. این پشته شامل تراشه، حافظه، شبکه، کامپایلر، کتابخانه و زیرساخت ابری میشود. TPU نمونهای از این رویکرد یکپارچه است. گوگل سختافزار را همراه با نرمافزار و زیرساخت موردنیاز آن توسعه داده است. در سوی دیگر، GPUهای مدرن نیز از یک تراشه ساده فاصله گرفتهاند. اکوسیستمهایی مانند CUDA، کتابخانههای AI و شبکههای پرسرعت، بخش مهمی از ارزش GPU را تشکیل میدهند.
همزمان، شرکتهای بیشتری به سمت Custom AI Accelerators حرکت میکنند. هدف آنها کاهش هزینه و افزایش بهرهوری برای Workloadهای مشخص است. این روند احتمالاً ادامه خواهد داشت. رشد مدلهای AI، نیاز به محاسبات تخصصیتر را افزایش میدهد. بنابراین، آینده صنعت احتمالاً به رقابت میان یک نوع پردازنده محدود نخواهد شد. در عوض، CPU، GPU، TPU و شتابدهندههای اختصاصی میتوانند در یک زیرساخت مشترک، نقشهای متفاوتی ایفا کنند.
جمعبندی؛ TPU دقیقاً چه مسئلهای را حل میکند؟
TPU یک شتابدهنده تخصصی برای عملیات مرتبط با یادگیری ماشین است. این پردازنده بهطور ویژه برای محاسبات Tensor و عملیات ماتریسی طراحی شده است. CPU انعطافپذیری بالایی دارد. GPU پردازش موازی گستردهای ارائه میدهد. TPU نیز تلاش میکند همین محاسبات را برای Workloadهای AI بهینهتر اجرا کند. مهمترین تفاوت TPU با پردازندههای عمومی، تخصص در یک حوزه مشخص است. این تخصص میتواند برای مدلهای بزرگ AI مزایای مهمی ایجاد کند. بااینحال، TPU برای همه کاربردها بهترین گزینه نیست.
نوع مدل، فریمورک، مقیاس پروژه، هزینه و نیازهای زیرساختی باید در تصمیمگیری لحاظ شوند. اهمیت TPU فراتر از خود تراشه است. این فناوری نشان میدهد که صنعت چگونه سختافزار را با نیازهای جدید هوش مصنوعی هماهنگ میکند. با رشد مدلهای مولد، مدلهای چندوجهی و Agentic AI، این روند اهمیت بیشتری پیدا خواهد کرد. پرسش اصلی آینده دیگر فقط این نیست که «چه مدل هوش مصنوعی ساختهایم؟» پرسش مهمتر این است که «این مدل را با چه معماری محاسباتی و با چه میزان بهرهوری اجرا میکنیم؟» TPU یکی از پاسخهای مهم صنعت به همین پرسش است.




