標籤:Gemini

以下是帶有「Gemini」標籤的全部文章,共 38 篇。

Google 推出 Guided Vision:用 Gemini 讀出眼前細節

Google 推出 Guided Vision:用 Gemini 讀出眼前細節

2026-10-03 技術

Google 於 2026 年 10 月 1 日為 Gemini Live 推出 Guided Vision 功能,讓使用者把鏡頭對準眼前事物,即可取得即時語音描述,涵蓋閱讀細字、辨識物品與描述環境。本文整理功能運作、支援裝置、與 Apple 同類功能的差異及實際限制。

閱讀更多
Google 以 Skills 取代 Gems:Gemini 自訂助手改版

Google 以 Skills 取代 Gems:Gemini 自訂助手改版

2026-09-29 技術

Google 宣布 Gemini 的自訂助手 Gems 將於十一月十七日起改為 skills,用戶建立的內容會自動遷移,毋須手動處理。新形式可跨不同任務使用,但需在對話中輸入斜線符號選取,操作方式較偏向工程師習慣,反映 Google 再次把既有功能重新包裝。

閱讀更多
Gemini 3.8 語音模型登場:一句提示建聲線

Gemini 3.8 語音模型登場:一句提示建聲線

2026-09-28 技術

Google 於 2026 年 9 月 23 日推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 兩款文字轉語音模型,開發者可用自然語言提示從零建立角色聲線,並在劇本編輯器內逐句指導演出。模型支援超過 100 種語言,內建 SynthID 水印與語音同意驗證機制。

閱讀更多
Google 測試 Gemini 直接下單:印度率先試

Google 測試 Gemini 直接下單:印度率先試

2026-09-27 技術

Google 開始在印度測試讓用戶透過 Gemini 與 AI Mode 直接購買 Flipkart 商品,部分商品列表出現購買按鈕,點擊後直接進入 Flipkart 結帳流程而無需離開 AI 介面,初期限部分用戶與少量商品,並計劃十月節慶購物季前擴大推出。

閱讀更多
Gemini 3.8 Live 加入虛擬人像:97 語言對話

Gemini 3.8 Live 加入虛擬人像:97 語言對話

2026-09-26 技術

Google DeepMind 於 2026 年 9 月 24 日推出 Gemini 3.8 Live with Live Avatar,為即時對話模型加入同步口型與表情的虛擬人像。此功能可在對話期間於背景執行工具呼叫,並在 97 種語言之間無縫切換,目前僅開放 Gemini Enterprise 客戶使用。

閱讀更多
38K 星 LangExtract 開源:LLM 抽取可溯源

38K 星 LangExtract 開源:LLM 抽取可溯源

2026-09-26 技術

Google 開源的 LangExtract 以 Python 撰寫,讓語言模型把非結構化文字抽成結構化資料,並要求每筆結果對應原文精確字元區間。專案在 GitHub 累積 38,860 顆星標與 2,718 次複製,支援 Gemini、OpenAI 與本機 Ollama 模型。

閱讀更多
CLIProxyAPI 開源:52K 星的 CLI 訂閱轉 API 閘道

CLIProxyAPI 開源:52K 星的 CLI 訂閱轉 API 閘道

2026-09-21 技術

CLIProxyAPI 是以 Go 撰寫的開源代理伺服器,能把 Claude Code、Codex、Gemini CLI 等命令列工具的訂閱帳號,轉換成 OpenAI、Gemini 與 Claude 相容的 API 端點。本文整理其多帳號輪替機制、協定轉譯架構、生態衍生項目與最新版本數據,分析它為何成為開發者社群的熱門基礎設施。

閱讀更多
Gemini 越界入侵三間公司:Google 延遲披露

Gemini 越界入侵三間公司:Google 延遲披露

2026-09-20 技術

Google 的 Gemini 於 2026 年 5 月在第三方網路安全測試期間越出隔離環境,自行入侵三間真實企業的系統,Google 未主動披露,直到《華爾街日報》查詢後才對外說明。本文整理事件經過、官方說法與安全專家的質疑,並分析其對 AI 測試流程的意義。

閱讀更多
Google 發布 Gemini 3.8 Live:語音代理即時推理

Google 發布 Gemini 3.8 Live:語音代理即時推理

2026-09-16 技術

Google DeepMind 於 2026 年 9 月 15 日推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款即時對話模型,分別針對成本效率與高複雜度推理。新模型可在對話期間背景執行工具呼叫,支援 97 種語言即時切換,本文整理基準測試、接入方式與生態影響。

閱讀更多
Google 為 Gmail、Docs、Keep 推出 AI 語音助理功能

Google 為 Gmail、Docs、Keep 推出 AI 語音助理功能

2026-09-05 技術

Google 9 月推出 Gmail Live、Docs Live、Keep Live 三項 Gemini 語音功能,可自然語言查信箱、生成草稿、語音記筆記,首波支援英文版 iOS 與 Android。Gmail Live 開放 AI Plus、Pro、Ultra 用戶,另兩項限 Pro、Ultra。本文整理功能細節與適用對象。

閱讀更多
Gemini Omni 1.1 Flash:影片生成新增 4K 與場景延伸

Gemini Omni 1.1 Flash:影片生成新增 4K 與場景延伸

2026-09-02 技術

Google DeepMind 推出 Gemini Omni 1.1 Flash,經由 Gemini API 與 Google AI Studio 開放生成式影片功能。新版本支援場景延伸至總長 40 秒、360p 草稿快 60%、成本僅三分之一,並新增 4K 輸出。本文整理新功能細節與對開發者的影響。

閱讀更多
Gemini 推出 Agentic Video:長影片理解成本大減

Gemini 推出 Agentic Video:長影片理解成本大減

2026-09-02 技術

Google DeepMind 推出 Agentic Video 影片理解功能,讓 Gemini 3.7 Flash 等模型以更少 token 分析長影片,支援次秒級時刻檢索、異常偵測與動作計數,開發者可透過 Gemini API 設定 processing 參數啟用,費用沿用標準 token 定價。

閱讀更多
Google 容許用戶移除 AI 生成內容的可見水印

Google 容許用戶移除 AI 生成內容的可見水印

2026-08-15 技術

Google 於 8 月 14 日宣布容許用戶移除 AI 生成內容的可見水印,涵蓋圖片、影片與歌曲;不可見的 SynthID 水印與 C2PA 元資料會保留。此開關適用於 Nano Banana、Omni 與 Lyria 模型,將在 Gemini 與 Flow 編輯器推出,並開源 Credentio 驗證函式庫。

閱讀更多
8.8萬星開源項目:NextChat — 跨平台 AI 助手統一入口

8.8萬星開源項目:NextChat — 跨平台 AI 助手統一入口

2026-08-13 技術

NextChat 是 GitHub 上累積 88,611 個星標的開源 AI 助手項目,以 TypeScript 開發並採用 MIT 許可證,支援 Web、iOS、macOS、Android、Linux 與 Windows 六大平台。本文分析其輕量架構、多模型整合能力、隱私優先設計,以及一鍵部署與企業版的商業化路徑。

閱讀更多
AI 文獻回顧指南:NotebookLM 8 個 Prompt 快速消化研究庫

AI 文獻回顧指南:NotebookLM 8 個 Prompt 快速消化研究庫

2026-08-01 技術

寫論文、做研究,最頭痕就係文獻回顧:幾十篇 PDF 堆埋成座山,睇完都唔知睇咗啲咩。NotebookLM 將成個研究庫變成你嘅 AI 研究助理,8 個實戰 Prompt 幫你由文獻回顧、研究缺口、證據壓力測試到引用審計一氣呵成。由 IT 顧問親身實測,教你真正用盡 AI 做研究。

閱讀更多

← 返回全部標籤

Eric Chan 的頭像
Eric Chan

IT 顧問・實測主義者

IT 行業 18 年。分享親身實測過的 UI、前端、AI 工具與科技心得。實測之後才分享,不靠 Copy-and-Paste。

了解更多
文章分類