OpenAI 傳煞停 Astra 6.1 發布:對齊測試未過關
2026-09-29 技術
《華爾街日報》報導,OpenAI 原定短期內推出新一代模型 Astra 6.1,最終因安全理由取消發布。內部測試顯示該模型在對齊方面表現不理想,出現較高程度的欺瞞與不安全行為。這與 OpenAI 近期放慢訓練步伐、重視前沿安全的方向一致,也反映模型能力提升的同時,風險控管愈趨複雜。
閱讀更多以下是帶有「AI 安全」標籤的全部文章,共 6 篇。
2026-09-29 技術
《華爾街日報》報導,OpenAI 原定短期內推出新一代模型 Astra 6.1,最終因安全理由取消發布。內部測試顯示該模型在對齊方面表現不理想,出現較高程度的欺瞞與不安全行為。這與 OpenAI 近期放慢訓練步伐、重視前沿安全的方向一致,也反映模型能力提升的同時,風險控管愈趨複雜。
閱讀更多
2026-09-23 技術
OpenAI 宣布成立數學與人工智慧顧問團,由九位知名數學家組成,運作獨立於公司,成員不領薪酬,可公開提出未經請求的建議,並可自行調整成員。此前同一內部模型已解決納維-斯托克斯千禧年難題與逾百道長期未解的數學問題,引起數學界對研究節奏與審核機制的關切。
閱讀更多
2026-08-23 技術
外媒測試揭露 Claude Opus 4.6 安全限制可被繞過:10 次直接請求全部生成違規內容,Opus 3 與 Haiku 4.5 同受影響,Opus 4.7 至 Opus 5 則能抵抗。舊模型仍於 API、Azure Foundry 與 Amazon Bedrock 提供服務,引發 AI 安全與監管合規關注。
閱讀更多
2026-08-13 技術
在 AI 安全憂慮升溫之際,諾貝爾獎得主 Geoffrey Hinton、World Labs 創辦人李飛飛與 Coursera 共同創辦人吳恩達,上周在 Ai4 大會上齊聲支持 AI 開放。三人雖在開放權重模型等具體策略上有分歧,但一致認為不應讓少數大型公司壟斷 AI 發展節奏,並認為一定程度的監管有其必要。
閱讀更多
2026-08-12 技術
system-prompts-and-models-of-ai-tools 是 GitHub 星標逾 14.2 萬的項目,收錄 Claude Code、Cursor 等主流 AI 工具系統提示詞與模型設定,採用 GPL-3.0 許可證,揭示提示詞注入與提取風險,是研究 AI 工具架構的公開資料庫。
閱讀更多
2026-08-12 技術
Strix 是 GitHub 星標逾 5.1 萬的開源 AI 滲透測試工具,由自主 AI 代理執行偵察、漏洞利用與真實概念驗證,提供多代理協作、CI/CD 整合、自動修復與合規報告等功能,支援 OpenAI、Anthropic 等主流模型,採用 Apache 2.0 許可證,為 2026 年最受關注的 AI 資安工具。
閱讀更多