Google 在去年 12 月發布過一段 Gemini 技術演示影片,但後來被開發者質疑影片中該模型的能力是虛構、經過剪輯的,使它看起來比實際更快、更即時且更有能力。
後來 Google 坦承該影片並非真實呈現,而是進行過一些微調,比如降低延遲,並且操作的過程也不是即時或語音進行,而是靠靜態圖像與提示操作。
但 Google 也稱影片中的所有使用者提示和輸出都是真實的,只是簡潔起見而進行了剪輯,該影片是作為展示使用 Gemini 構建的多模態用戶體驗是什麼樣子,這樣做是為了激勵開發人員。
官方展示 Gemini 強大的多模態功能:
The potential of Gemini:這一系列影片展示了 Gemini multimodal AI 在科學、推理、音頻、程式、數學與物理方面的能力。例如在沒有光學字元辨識(OCR)協助下,用戶只要給它一張手寫的數學試卷,Gemini 就能立即批改指出錯誤,還能進一步回答錯誤思維在何處,除了能逐步詳細解題,還能進一步產出相似題型提供練習。
開發人員可以從 Google 的 Github 上面找到各種程式語言的 Gemini AI SDK,裡面都有 sample code 可以參考,像我想自己寫一個 Android 應用程式,來看看 GenAI 對於圖像推理的表現,以及在手機 APP 上的使用體驗如何,那我就可以從這裡下載 Google AI SDK for Android,並執行裡面的 sample code 看我們要如何使用它。
也有人用 Python 寫了可以在電腦上執行的腳本,透過電腦的攝像頭和麥克風來將使用者的語音提示和相機拍攝的畫面,作為輸入讓 Gemini Pro 進行推論,並透過 Text to Speech 將結果讀出來,有興趣的可以參考下面文章。
目前 Android Studio 最新預覽版已經有提供 Gemini API Starter 項目模板,供開發者開始使用適用於 Android 的 Google AI SDK。此外,Google AI Studio 也為開發者提供了一種簡化的方式來集成 Gemini Pro 模型、製作提示、創建 API 金鑰,以及輕鬆將想法轉化為 AI 應用。
Gemini Pro API有下面幾種常見的使用例:
根據純文本輸入生成文本
從文本和圖片輸入生成文本(多模態)
構建多輪對話(聊天)
使用streaming方式傳輸加快互動速度
除了上面第2項以外,其他都是使用 gemini-pro 模型,使用多模態生成文本,必須選擇 gemini-pro-vision 模型,可以同時輸入文本和圖片,送出提示的圖片格式要求,可參考提示資料和設計裡面的內容。在 Google 提供的 sample code 裡面,將圖片大小縮減為 768 像素,用以加快 Gemini AI 推論和生成內容的速度。
發送給 Gemini AI 模型的每個提示都包含用於控制模型如何生成回答的參數值,不同的參數值設定,會使模型生成不同的回答。詳細請參閱模型參數的內容。
以下是一些可以透過 Gemini Pro Vision 提供幫助的視覺回答 (VQA)任務類型應用場景:
擷取影像並要求 Gemini Pro Vision 建立與影像相關的內容,例如針對設計的產品提供文案,或者是根據一些食材照片,提供料理建議,甚至是食譜和做法。
擷取報章雜誌的文章畫面,要求 Gemini Pro Vision 總結其中的重點內容。
要求 Gemini Pro Vision 分析視覺化資料(如線圖、圓餅圖),並根據視覺化提供關鍵見解。
擷取外文的菜單目錄,要求 Gemini Pro Vision 將菜單上的品項名稱翻譯為母語。
過年前,我花了一兩天實作了一個 Android 應用程式,用來測試 Gemini AI 在智慧型手機上的使用體驗。由於我要在同一個 UI 畫面中,同時可以看見相機畫面,並呈現 AI 模型推論後的文字結果,所以我將 Camera View 做成懸浮視窗,並使用 Android 內建的 Speech to Text 來用語音輸入提示(支援多國語言的語音輸入),同時也使用 Text to Speech 來使推論結果除了文字呈現外也能用語音讀出來。
我將模型的 Temperature 設置為 0.9,並且由於是直接拿兩年多前開發的 Android 相機應用來添加 Gemini Pro API,所以實作中並沒有用到 Gemini API Starter 項目模板,而是在現有的 Android 專案進行開發。
簡單用過 Gemini Pro 之後,我認為雖然目前多模態 AI 可能還不算非常成熟、聰明、即時,但是隨著軟體、硬體技術的發展,相信不久的將來,我們就會看到各種 AI 應用場景落地生根,甚至是完全進入生活中的各個領域,一切都會變得理所當然,甚至讓你感受不到 AI 技術的存在(畢竟 AI 本來就是複雜系統下的自然產物罷了)。正如 N 年前我看過推特創辦人說過的一句話:最厲害的技術,就是讓使用者完全察覺不到技術的存在。
以下是一些心情隨筆,週六在網路上看到一篇文章,牽動我產生一點想法:技術大神 Linus Torvalds 正式宣告:『 Linux Kernel 開源專案會擁抱 AI,不爽的人大可 Fork 一套自己來,不然就閃開』。 Linus 是誰?Linux 又是什麼東西,不知道的話可以自己去問 AI。我想起快20年前大學時期時,曾學過玩過幾年 Linux 搞伺服器,記得當初最早接觸的好像是 Fedora 4,然後 Ubuntu 也玩過,但後來開始工作用 Mac 電腦之後就沒有再去學 Linux 了。 連技術大神都擁抱 AI 了,台廠裡卻還有很多意圖維護自己身為舊石器時代人類碼農最後尊嚴的智障狗,在那邊說著嘲諷、看不起 AI 的可悲話(以為自己的工人智慧才是最高級智慧...笑屎💩)。像是每次我用 AI 來解決一些問題,就有一些北七在那邊臭一些諸如:『可是 AI 給的東西到底對不對?』這種話( AI 給的東西對不對端看你會不會用啦,啊你不會用、瞧不起,更抗拒使用,結果就是你們只能在旁邊說這些酸酸言論嘴秋自嗨而已啦! ),不然就是用不屑、找碴的口氣說:『那個是 AI 弄的』( 所以你這個逼哀仔是比較高尚是不是? ),更智障的還會嘲諷:『你是不是 AI 走火入魔?』( 嗯~你媽才入魔,你全家都綠圾邪教走火入魔唷^_^ )。總之我前段時間真的已經聽這些無能者的可悲發言聽到覺得很噁心了! 我個人是覺得,時代的轉輪已經在瘋狂的向前運轉,但某些台廠吃屎狗還在那邊活在山洞裡鑽木取火自我感覺良好, 堅守工人智慧至上,其實真的挺可悲的啦 ! 關於如何在工作上使用 AI?我想到一個最近的活生生(且噁心)的實例: 前陣子我們 team 有一票人在研究某大廠的產品架構,想要在省電和降低功耗上面和人家對齊,但我聽說他們的硬體已經不想更動了,所以只能想辦法從中層、上層去做優化。然後這個主題好像去年就已經持續搞了一整年,搞到前陣子今年都快過完一半了,還搞不出個屌毛。 然後有位上級就叫我去幫忙看一下這個項目,看能不能搞出什麼名堂出來。然後 SW team 在主導這玩意兒的名義 leader,竟然是某位根本不懂技術的女經理,之前有幾次她要我加一些莫名其妙的測試功能(要比喻的話,就像是他們試圖在開車時把車內的冷氣系統關閉,然後說我們的車子變省油了,他媽的在搞笑484啊?),我聽了都覺得荒謬可笑! 我心想:『你們...