大數據處理分析與應用:146 題線上練習
「大數據處理分析與應用」是 iPAS AI 應用規劃師中級考試科目(代號 L22)。本頁整理 146 題免費練習題,依 5 個知識主題分類,每題可線上作答並附逐題解析。
「大數據處理分析與應用」是 iPAS AI 應用規劃師中級考試科目(代號 L22)。本頁整理 146 題免費練習題,依 5 個知識主題分類,每題可線上作答並附逐題解析。
考試範圍定位
- 考試等級
- iPAS AI 應用規劃師中級能力鑑定
- 考試科目
- 大數據處理分析與應用(L22)
- 考試科目
- 大數據處理分析與應用(L22)
練習題列表(共 146 題)
以下依知識主題分組,每組節錄部分題目;點各主題標題可查看該主題全部題目。
機率統計基礎(83 題)→
若某數據點的Z分數(Z-Score)= 2,請問代表下列哪一種意涵?
使用Python的pandas套件處理各商品銷售數據(變數為df)時,若需計算「總銷售額」欄位的敘述性統計量(如平均值、標準差等),應使用下列哪一種語法?
附圖為某資料之分佈圖,此圖資料的偏態(Skewness)值較有可能為下列哪個選項?(圖示:左偏分佈,主峰偏右,左側有長尾)
累積分佈函數(Cumulative Distribution Function, CDF)可用於描述隨機變數的機率分佈特性,其數學定義為下列何者?
在進行資料分析時,會遇到類別型(Categorical)與數值型(Numerical)資料格式。關於這兩種資料格式的處理,下列敘述何者不正確?
資料科學家為分析顧客行為,利用現有欄位「銷售金額」與「瀏覽次數」,計算出新變數「銷售金額/瀏覽次數」。此動作屬於下列哪一類特徵工程方法?
大數據處理技術(9 題)→
在資料庫的ACID特性中,下列何者為「原子性(Atomicity)」的正確定義?
某人工智慧團隊使用分散式資料庫(Distributed Database)儲存模型訓練資料,並在更新訓練樣本時啟用多節點交易。若其中一個節點在交易過程中發生錯誤,但系統仍確保整體資料不會出現部分更新、最終狀態維持一致,下列何者最能說明此現象?
某串流影音平台運用關聯規則學習(Association Rule Learning)分析用戶的觀影行為,發現若使用者觀看了科幻影集,則有較高機率接著觀看超級英雄電影。分析顯示,同時觀看這兩種類型的使用者約佔全部觀影紀錄的12%,而觀看科幻影集的使用者中,有50%也觀看了超級英雄電影,該規則的提升度(Lift)為1.8。根據上述資訊,下列哪一項推論最為正確?
在圖形資料庫(Graph Database)中建模社群平台資料時,若每筆「按讚」行為都包含時間戳記(Timestamp)與裝置類型(Device Type)等資訊。若希望同時保留使用者與貼文之間的互動關係,並能有效查詢「按讚」的行為屬性,下列哪一種設計方式最為合適?
分析師在載入vgsales.csv資料後(欄位包含Name、Platform、Year、Genre、Publisher、NA_Sales、EU_Sales、JP_Sales、Other_Sales、Global_Sales),檢視Year欄位的資料型態,發現它是float64,而非一般年份常用的整數。下列哪些原因可能導致這種狀況? 原因A:CSV檔中Year欄位有缺失值(NaN),導致Pandas自動將整欄轉為浮點數。 原因B:CSV檔中的年份資料原本是字串(如"2006"),Pandas轉換時出錯而變成浮點數。 原因C:Pandas預設會將所有數值型態讀取為float64,不論資料是否為整數。 原因D:CSV檔中的年份資料可能包含小數點(例如2006.0),因此被視為浮點數。
研究團隊接下來想要將Year欄位轉換為整數型態,以便後續進行年份趨勢分析。考慮到資料中可能包含缺失值(NaN),請選出最合適的轉換方式。 A) data['Year'] = data['Year'].astype(int) B) data['Year'] = data['Year'].fillna(0).astype(int) C) data['Year'] = data['Year'].fillna(1).astype(int) D) data['Year'] = data['Year'].astype('Int64')
大數據分析方法與工具(25 題)→
在進行資料前處理時,若使用Label Encoding將類別變數轉換為數字型態,下列何者為最常見的潛在風險?
在處理分類問題時,若某一類樣本數明顯少於其他類別,研究人員可能採用隨機過採樣(Random Oversampling)以平衡資料比例,此方法最常造成下列哪一種問題?
某組資料共10項標籤如下:A, A, A, A, A, B, B, B, B, B。若該標籤僅有A、B兩種,請問這組資料的「正規化吉尼不純度(Normalized Gini impurity)」為何?
某投資研究員希望分析四檔科技類股(A、B、C、D)每日報酬率的變化趨勢,以判斷這些股票之間是否存在高度相關性與共變動性,並評估投資組合分散風險的程度。若研究員希望以單一圖表快速呈現各股票間的關聯強度與方向,下列哪一種視覺化呈現方式最適合?
若在高維度(>500維)的資料上應用DBSCAN(Density-Based Spatial Clustering of Applications with Noise)演算法,卻發現所有資料點皆被判定為雜訊(Noise),下列何者為最有可能的原因?
某團隊在開發風險評估模型時,使用主成份分析(Principal Component Analysis, PCA)進行降維。輸入資料包含三個數值欄位:「交易金額(單位:新台幣)」、「交易次數(次/月)」與「年齡(歲)」,其數值量級分別約為10⁶、10¹與10²。分析人員直接將原始數據帶入PCA,結果第一主成分(PC1)幾乎完全由「交易金額」主導。下列哪一項作法或判斷最合理?
大數據在人工智慧之應用(14 題)→
下列何者為同態加密(Homomorphic Encryption)技術的核心特性?
某電商公司欲利用顧客行為資料建立消費預測模型,其中「會員等級」欄位包含「一般、白金、黑卡」三種類別。若模型採用梯度提升樹(Gradient Boosting Tree)演算法,資料科學家在進行特徵編碼時應特別注意下列何種情況?
某企業建置生成式AI系統,利用大量客服紀錄與產品評論資料訓練語言模型,由於資料來源多樣,且包含非結構化文字、影像與表格資訊,團隊希望在不降低模型效能的前提下,提升資料處理效率與一致性,下列哪一種資料處理策略最適合?
某電信公司導入生成式AI客服系統,利用過去對話紀錄與用戶行為資料訓練語言模型,在資料治理與合規審查過程中,團隊發現模型可能會在回答中生成包含真實姓名、電話或交易資訊的內容。為確保系統符合各個法令及生成式AI的安全與隱私要求,下列哪一項作法最符合實務可行及法規原則?
某研究人員欲使用線性迴歸模型(Linear Regression Model)分析變數Y與X之間的關係,但發現Y的分佈明顯右偏,且其變異數隨X的增大而增加。為滿足模型假設並提升預適效果,下列哪一種前處理方法最為合適?
考慮資料集已經填補遺漏值,參考下圖執行結果,OLS迴歸輸出顯示:R-squared=0.898,迴歸係數:youtube=0.0455、facebook=0.1891、newspaper=-0.0006,截距=3.5561,newspaper的p值=0.914(不顯著)。 程式碼架構: X = df[['youtube','facebook','newspaper']] y = df['sales'] reg = 空格1 print(reg.coef_) X2 = sm.add_constant(X) model_sm = 空格2 print(model_sm.summary()) 各陳述: A: 空格1完整語法 reg = LinearRegression().fit(y, X) B: 空格1完整語法 reg = LinearRegression().fit(X, y) C: print(reg.coef_)結果為包括截距項等4個係數值 D: 空格2完整語法 sm.OLS(X2, y).fit() E: model_sm迴歸模型的所有迴歸係數在α=0.05之下具有顯著的解釋力 F: 截距項係數值為3.5561 下列哪些陳述正確?
尚未細分能力指標的考題(15 題)
附圖為某資料之分佈圖(直方圖右側集中、左側出現負值的長尾,主峰位置約在 40 附近),此圖資料之偏態(Skewness)值較有可能為下列哪個選項?
某組資料共 10 項標籤如下:A, A, A, A, A, B, B, B, B, B 若該標籤僅有 A、B 兩種,請問這組資料的「正規化吉尼不純度(Normalized Gini impurity)」為何?
某客服中心統計資料發現,平均每小時會接到約 20 通顧客來電,但每分鐘的來電數量不固定,可能為 0、1、2 通不等。這些來電事件彼此獨立,且在短時間內,發生的機率與時間長短成正比。若要以機率模型描述「每分鐘接到幾通來電」的機率分佈,下列哪一種最適合使用?
某企業建置生成式 AI 系統,利用大量客服紀錄與產品評論資料訓練語言模型,以自動生成客服回覆與知識摘要。由於資料來源多樣,且包含非結構化文字、影像與表格資訊,團隊希望在不降低模型效能的前提下,提升資料處理效率與一致性,下列哪一種資料處理策略最適合?
某電商資料團隊繪製顧客單筆消費金額的箱型圖後發現:四分位距(IQR)範圍極小,但上鬍鬚拉得很長,且在高金額區域有多筆離群值。若希望協助行銷部門依據消費層級設計分群策略,下列哪一種視覺化方式最有助於凸顯不同消費層級間的差異?
某團隊在開發風險評估模型時,使用主成分分析(Principal Component Analysis, PCA)進行降維。輸入資料包含三個數值欄位:「交易金額(單位:新台幣)」、「交易次數(次/月)」與「年齡(歲)」,其數值量級分別約為 10^5、10^1 與 10^2。分析人員直接將原始數據帶入 PCA,結果第一主成分(PC1)幾乎完全由「交易金額」主導。下列哪一項作法或判斷最合理?
若開發一個用於罕見疾病自動診斷的分類模型,目前資料集中確診樣本僅佔不到 1%,且因為標註成本高,短期內無法取得更多資料。在此情況下,若希望提升模型對少數類的偵測能力,同時避免過擬合,下列哪一種策略最為合理?
請參考附圖,下列虛擬程式碼(pseudocode)最可能是在描述何種驗證法? Input: - data_set: 包含 N 筆資料的資料集 - model_training_function: 用來訓練模型的函式 - model_evaluation_function: 用來評估模型的函式(如計算誤差或準確率) Output: - 平均評估指標(如平均準確率或平均誤差) Algorithm: 1. 初始化評估指標列表 metrics = [] 2. 對 i = 1 到 N: a. 將第 i 筆資料作為測試集 test_data b. 將其餘 N-1 筆資料作為訓練集 train_data c. 使用 model_training_function 在 train_data 上訓練模型 d. 使用訓練好的模型對 test_data 做預測,計算評估指標 metric_i e. 將 metric_i 加入 metrics 3. 計算 metrics 的平均值 mean_metric 4. 回傳 mean_metric
請參考附圖,下列虛擬程式碼(pseudocode)最可能是在描述何種演算法? Input: - data_points: N 筆資料,每筆資料有 D 個特徵 - X: 要分成的群數 Output: - clusters: 每筆資料所屬的群編號 - centroids: 每個群的中心點 Algorithm: 1. 隨機選擇 X 個資料點作為初始中心 2. 重複以下步驟直到收斂: a. 分群: 對每個資料點,計算它到每個中心的距離,將資料點指派給距離最近的中心 b. 更新中心: 對每個群,計算該群中所有資料點的平均值,將群中心更新為這個平均值 3. 當群中心不再變動時,停止 回傳每筆資料的群編號 clusters,以及最後的群中心 centroids
一間遊戲市場研究公司正在分析全球電子遊戲銷售情況,並準備建立一份「熱銷遊戲銷售報告」。分析師取得了一份名為 vgsales.csv 的資料集,內容包含全球銷量超過 10 萬份的電子遊戲清單。研究團隊希望透過這份資料,了解不同年份、平台與地區的銷售趨勢。 分析師在載入資料後,檢視 Year 欄位的資料型態,發現它是 float64,而非一般年份常用的整數。他想了解這樣的情形為什麼會發生。請問下列哪些原因可能導致這種狀況? 原因 A:CSV 檔中 Year 欄位有缺失值(NaN),導致 Pandas 自動將整欄轉為浮點數。 原因 B:CSV 檔中的年份資料原本是字串(如 "2006"),Pandas 轉換時出錯而變成浮點數。 原因 C:Pandas 預設會將所有數值型態讀取為 float64,不論資料是否為整數。 原因 D:CSV 檔中的年份資料可能包含小數點(例如 2006.0),因此被視為浮點數。
為了觀察各遊戲平台的市場表現,分析師想要統計每個平台的全球銷售總額,並以長條圖呈現。請選出最能正確實現此分析的程式碼。
團隊希望比較北美、歐洲、日本及其他地區的整體銷售比例,並使用 seaborn 套件以長條圖的形式進行可視化分析。請選出能正確顯示這些地區銷售總額比例的程式碼。
使用銷售資料集(marketing.csv)進行迴歸分析,附圖程式碼展示資料載入與處理。根據 df.describe() 的輸出結果,下列何者正確? (describe() 輸出:youtube count=200, mean=176.451, std=103.025, min=0.840, 25%=89.25, 50%=179.700, 75%=262.590, max=355.680;facebook count=199, mean=27.820, std=17.808, min=0.000, 25%=11.940, 50%=27.000, 75%=43.680, max=59.520;newspaper count=200, mean=36.665, std=26.134, min=0.360, 25%=15.300, 50%=30.900, 75%=54.120, max=136.800;sales count=200, mean=16.827, std=6.261, min=1.920, 25%=12.450, 50%=15.480, 75%=20.880, max=32.400)
參考下圖計算各變數的遺漏值(NaN)個數結果,下列何者正確? (輸出結果:youtube 0 / facebook 1 / newspaper 0 / sales 0 / dtype: int64) 選項 A: df.isnull().sum() 選項 B: df.isNaN().sum() 選項 C: df.isna().sum() 選項 D: df.isnan().sum()
考慮資料集已經補填遺漏值,參考下圖執行結果,下列何者正確? from sklearn.linear_model import LinearRegression import statsmodels.api as sm X = df[['youtube', 'facebook', 'newspaper']] y = df['sales'] reg = 空格1 print(reg.coef_) X2 = sm.add_constant(X) model_sm = 空格2 print(model_sm.summary()) (OLS 結果:R-squared 0.898、Adj. R-squared 0.896、F-statistic 573.0、No. Observations 200、Df Residuals 196、Df Model 3;coef: const 3.5561、youtube 0.0455、facebook 0.1891、newspaper -0.0006;P>|t|: const 0.000、youtube 0.000、facebook 0.000、newspaper 0.914) A:空格 1 完整語法 reg = LinearRegression().fit(y, X) B:空格 1 完整語法 reg = LinearRegression().fit(X, y) C:print(reg.coef_) 結果為包括截距項等 4 個係數值 D:空格 2 完整語法 sm.OLS(X2, y).fit() E:model_sm 迴歸模型的所有迴歸係數在 α=0.05 之下具有顯著的解釋力 F:截距項係數值為 3.5561
本考點的相關 AI 術語
先掌握以下術語的定義與應用情境,再回來刷題,正確率會明顯提升。
下一步
練完本考點的題目後,回到 題庫總覽 查看其他科目的題數分布, 或直接進行 完整模擬考 驗證實力。 還不確定弱點在哪,先做 診斷測驗; 想了解歷年出題趨勢與高頻考點,參考 考古題與模擬測驗總整理。