企業 AI 正在從單個模型演變為統一的資料生態系統。

隨著企業組織擴展其 AI 計劃,一個令人興奮的機會出現了:建構一個統一的資料閘道,連接 AI 管道的每一步,從原始資料到計算處理,再到特徵目錄和模型服務。這不僅關乎管理複雜性,還關乎為加速創新奠定基礎。

企業經常面臨的一個挑戰是,資料科學家最終會一遍又一遍地重建相同的功能。一個團隊為客戶流失預測模型計算客戶生命週期價值,3 個月後,另一個團隊需要為推薦引擎進行相同的計算,但他們不知道它已經存在。因此,他們需要從頭開始重建,不僅引入了不一致的情況,還浪費了數週的開發時間。

這就是功能重用問題,它會浪費企業組織的時間和品質。

什麼是特徵儲存?

特徵儲存」是一個集中式平台,用於管理、儲存和提供機器學習特徵 (模型用於進行預測的輸入變數)。可以將其視為專為 artificial intelligence (AI) 設計的資料目錄,資料科學家可以在所有機器學習 (ML) 中探索、重複利用和共用特徵,而不必費力地翻閱文件或詢問同事「以前有人計算過月購買速度嗎?」專案。

但是,特徵儲存的作用不僅僅是目錄特徵。它解決了三個關鍵問題:

  1. 功能重用:它允許開發人員探索和重用現有功能,而不是從頭開始重建
  2. 訓練與服務一致性:它有助於加強一致性,因此模型在訓練和生產中使用相同的特徵計算(消除了可怕的「它在我的 Notebook 中有效」問題)
  3. 營運簡便性:它支援通過單一介面管理功能管道、版本控制和監控

紅帽 OpenShift AI 包含基於 開源 Feast 專案 的內建特徵儲存功能,是平台的原生元件。無需單獨安裝,當您的團隊準備好採用功能優先的開發實務時,即可使用並啟用它。

統一資料閘道帶來的機遇

Feast 可以作為所有 AI 資料管道的統一存取層。Feast 建立在久經考驗的開源基礎之上,擁有 6,500 多個 GitHub 星標和 1,600 萬+ 次下載,將資料來源、計算引擎 (Ray/Spark) 和編排器 (KFP/Airflow) 連接到一個統一的目錄中,使企業組織能夠建構供應商中立的資料。

管道前端:簡化複雜的 AI 資料工作流程

Red Hat OpenShift AI 的特徵儲存支援這種統一的方法:

  • 供應商中立的基礎:與 Spark、Ray、Milvus、Elastic、Postgres 和許多其他流行資料庫整合,您可以選擇自己的基礎架構
  • 完整的管道可見性:從原始資料到特徵工程再到模型推理
  • 自由混合部署:在本地、雲端和邊緣環境中一致地運行
  • 開源創新:基於 Feast 久經考驗的基礎 建構而成,Feast 的下載量已超過 1,600 萬次,並得到許多企業的使用和貢獻,包括 Shopify、NVIDIA、沃爾瑪等

這種方法還可以解決真正的企業挑戰。聯邦機構可以在利用雲端運算的同時在本地處理敏感資料。金融機構可以滿足合規要求,同時保持營運靈活性。製造公司可以在邊緣處理資料,同時連接到集中式分析。

三層架構:資料、計算和目錄

紅帽的 AI 資料管理方法建立在一個簡單但強大的洞察之上:最好的企業平台連接現有基礎架構,而不是取代它。我們將通過金融服務公司採用特徵儲存的案例,向您展示其在實務中的運作方式。

第 1 層:資料來源 — 就地掌握資料

以一家實施詐欺偵測的大型銀行為例。他們的客戶資料儲存在本地 Oracle 資料庫中(滿足監管合規要求),事務流通過 AWS 上的 Kafka 傳輸(現代即時處理),而歷史模式則儲存在 Snowflake 資料倉儲中(分析團隊 3 年前的投資)。

傳統的特徵儲存解決方案迫使人們做出選擇:將所有內容遷移到平台,或者根本不使用特徵儲存。這就造成了一個非常困難的局面:Oracle 資料庫由於合規性而無法移動,團隊不會放棄他們的 Snowflake 投資,而即時 Kafka 管道對營運至關重要。

紅帽的特徵儲存通過通用資料連接解決了這一問題:

  • 隨時隨地連接:功能可以從本地資料庫、雲端儲存、邊緣感測器和串流媒體平台中提取,所有這些都在同一個功能定義中
  • 保留投資:詐欺偵測團隊繼續使用現有的基礎架構,不會產生遷移成本,也不會中斷營運
  • 保持合規:敏感的客戶資料保留在合規的本地資料庫中,同時功能儲存可編排受監管的存取

該銀行的詐欺偵測團隊只需定義一次特徵(「customer_transaction_velocity_30d」、「account_risk_score」、「merchant_category_pattern」),然後特徵儲存會處理從 Oracle 提取資料、與 Kafka 流連接以及使用 Snowflake 歷史記錄進行豐富的複雜性。資料科學家再也不會編寫另一個 JOIN 語句來將這些來源拼接在一起。

第 2 層:計算處理:靈活應對各種工作負載

現在,我們來談談如何計算這些特徵。詐欺偵測團隊每天需要處理數十億筆交易,但不同的功能具有不同的計算需求:

  • 在 SQL 中高效運行簡單的聚合(事務計數)
  • 複雜模式偵測(行為異常)需要使用 Spark 進行分散式處理
  • 即時風險評分(亞秒級延遲)需要輕量級串流計算

大多數功能平台會將您鎖定在其偏好的計算引擎上。如果您已經投資了 Spark 專業知識和基礎架構,那麼您被告知要放棄它並學習他們的專有系統。如果您需要 Ray 來進行 ML 密集型轉換,那您就不走運了。

紅帽的特徵儲存提供計算靈活性:

  • 供應商中立的引擎:對 Ray 和 Spark 的原生支援,以及將您自己的計算框架 (Spark、Ray 等)
  • 開放標準:使用標準 Python 和 SQL 定義的功能,而不是造成鎖定的專有 DSL

詐欺偵測團隊在 Postgres 中運行簡單的聚合(已部署),在現有的 Spark 集群中執行複雜的行為模型(保留多年的基礎架構投資),並在分支機構位置部署即時評分引擎以進行即時詐欺偵測。相同的功能定義,不同的計算策略(基於業務需求)。

第 3 層:統一目錄——所有功能的統一介面

這就是挑戰的開端。詐欺偵測團隊定義了從 3 個資料來源提取並在 2 個計算平台上執行的 50 多個功能。如果沒有統一的目錄,會出現以下情況:

  • 資料科學家浪費大量時間在 Git 儲存庫、Jupyter Notebook 和團隊知識中搜尋,試圖弄清楚是否有人已經建構了月度交易速度計算器
  • 當他們確實找到某個功能時,他們發現它不相容——不同的欄名稱、不同的時間戳、不同的聚合視窗
  • 生產工程師很難理解功能的依賴關係,即哪些功能依賴於哪些資料來源和計算作業?
  • 合規官無法回答「誰有權存取敏感的客戶功能?」這個問題。

統一目錄 (Feast) 可以解決所有這些問題:

  • 單一介面:資料科學家通過一個搜尋介面即可發現所有 50 個特徵,無需搜尋儲存庫或在 Slack 中詢問
  • 完整的管道可見性:每個功能都能準確顯示資料的來源、所需的計算能力以及使用這些資料的模型
  • 企業就緒型監管:內建基於角色的存取權限控制 (RBAC) 意味著只有授權團隊才能存取敏感功能,完整的稽核追蹤可追蹤每次存取,審批工作流程則強制執行生產部署標準

以下是兩個不同使用者的情況:

管理工作流程(平台團隊):

  1. 啟用特徵儲存:在 OpenShift AI 控制面板中,前往功能儲存設定並啟用元件(內建,無需單獨安裝)
  2. 配置許可權:定義哪些資料科學團隊可以建立特徵,哪些只能使用特徵,以及每個團隊可以存取哪些資料來源
  3. 監控營運:儀表板顯示功能管道運行狀況、資源利用率和資料新鮮度

資料科學家工作流程:

  1. 探索功能:在功能目錄中搜尋「transaction」- 尋找 12 個現有功能,包括反詐欺團隊上個季度建構的「customer_transaction_velocity_30d」
  2. 瞭解上下文:點擊功能以查看資料來源 (Kafka 事務 + Oracle 客戶)、計算需求 (Spark 作業,每天運行) 和範例使用程式碼
  3. 在新模型中重複使用:將功能定義複製到其推薦引擎專案中,並在詐欺偵測和推薦之間獲得相同的計算邏輯和一致性
  4. 快速迭代:直接從功能目錄啟動預先整合的 Jupyter Notebook,並已配置身分驗證

結果: 過去需要 3 天的研究時間、5 次 Slack 對話以及偵錯不一致的計算,現在只需要 10 分鐘。當反詐欺團隊改進其交易速度計算時,所有下游模型都會自動從增強中受益。

這就是統一目錄的複合價值,建立的每一項功能都能使整個企業的 AI 開發更快、更可靠、更一致。

對業務的影響:從戰術工具到戰略平台

這種三層架構將特徵儲存從戰術元件轉變為戰略資料閘道,以編排所有 AI 資料消耗。您無需為不同的 AI 計劃管理單獨的管道,而是建立一個受監管的單一入口點,為傳統 ML 模型、生成式 AI 應用和進階混合工作流程提供服務。

業務影響是變革性的:

  • 加快創新:資料科學家探索並在專案中重複利用功能,而不是從頭開始重建,從而縮短了產品上市時間
  • 加強監管:對所有 AI 計劃的資料存取政策、稽核追蹤和合規性要求進行單點控制
  • 更好的經濟效益:共用基礎架構和可重複使用的資產可降低每個專案的成本,同時提高品質
  • 戰略靈活性:獨立於平台的架構,可隨著技術堆疊的發展進行調整,保持創新能力

隨著 AI 成為業務營運的核心,供應商中立資料基礎架構的早期採用者將在創新速度和卓越營運方面獲得可持續的競爭優勢。

結論:為取得成功奠定 AI 資料基礎

Red Hat OpenShift AI 的特徵儲存功能不僅僅是一種特徵管理解決方案,更是您建構供應商中立 AI 資料生態系統的平台,有助於加速創新、優化營運並保持戰略靈活性。

您的資料策略為您的 AI 未來賦能——建立在隨著企業能力的增長而發展的基礎上,同時保留創新的靈活性。

開始使用

準備好探索適合您企業的特徵儲存方法了嗎?


About the authors

Jonathan Zarecki is Principal Product Manager for AI data infrastructure at Red Hat, focusing on vendor-neutral solutions that accelerate enterprise AI innovation. He leads product strategy for feature stores, and enterprise AI data management within the Red Hat AI portfolio. Prior to Red Hat, Jonathan was a Co-founder & CPO at Jounce (acquired by Red Hat), where he specialized in MLOps platforms and enterprise AI deployment strategies.

Francisco has spent over a decade working in AI/ML, software, and fintech at organizations like AIG, Goldman Sachs, Affirm, and Red Hat in roles spanning software, data engineering, credit, fraud, data science, and machine learning. He holds graduate degrees in Economics & Statistics and Data Science & Machine Learning from Columbia University in the City of New York and Clemson University. He is a maintainer for Feast, the open source feature store and a Steering Committee member for Kubeflow, the open source ecosystem of Kubernetes components for AI/ML.

Seasoned Software and Security Engineering professional.
Primary interests are Security, Linux, Open Source, AI/ML, Malware
Loves working on the command-line.

UI_Icon-Red_Hat-Close-A-Black-RGB

Keep exploring

Browse by channel

automation icon

Automation

The latest on IT automation that spans tech, teams, and environments

AI icon

Artificial intelligence

Explore the platforms and partners building a faster path for AI

cloud services icon

Cloud services

Get updates on our portfolio of managed cloud services

security icon

Security

Explore how we reduce risks across environments and technologies

edge icon

Edge computing

Updates on the solutions that simplify infrastructure at the edge

Infrastructure icon

Infrastructure

Stay up to date on the world’s leading enterprise Linux platform

application development icon

Applications

The latest on our solutions to the toughest application challenges

Original series icon

Original shows

Entertaining stories from the makers and leaders in enterprise tech