Veri / ML projesi · Bölüm 2 · Temmuz 2026

Bir rulman modeli hiç görmediği bir düzeneğe taşınır mı?

Bölüm 1, tek bir test düzeneğinde arıza tahmin etmeyi öğretti. Sıradaki soru: bunların ne kadarı hiç görmediği bir makineyle karşılaşınca ayakta kalır? Bu, kendi arabanın tuhaf ses çıkarmaya başladığını hemen fark etmekle bir yabancının arabasına teşhis koymak arasındaki fark. Her düzenek titreşimi farklı renklendirir ve ömürler 100 kat saçılır — 37 dakikadan 45 güne. Bu çalışma üç herkese açık bozulana-kadar-çalıştırma veri setini (NASA IMS makaralı, XJTU-SY ve FEMTO bilyeli rulmanlar, 36 ömür) birleştiriyor, kalan ömrü yakıt göstergesi tarzı bir ömür oranına çeviriyor ve genelleme açığını doğrudan ölçüyor: yalnızca rulman değil, düzeneğin tamamı eğitimden saklanınca model ne kadar kötüleşiyor?

36bozulana kadar çalıştırılan rulman; 3 düzenek, makaralı + bilyeli, ömürler 37 dk – 45 gün
≈ 0genelleme açığı: medyan ömür-oranı hatası 0,188 (rulman görülmemiş) vs 0,169 (düzeneğin tamamı görülmemiş), eşit ön işleme
21.7×fizik testi geçildi: belgelenmiş dış bilezik arızasında BPFO zarf bandı parlıyor
−52%en zor düzeneğin geç evre hatası, sebep doğru teşhis edildikten sonra: 0,318 → 0,153
0.35en kötü tek rulman hatası — medyanın sakladığı sayı

Yöntem

Üç düzeneğe aynı dili konuştur, sonra birini sakla.

Adım 1 · Tek tabloSaat değil, ömür oranı

"X saat kaldı" düzenekler arasında taşınmaz — bir rulman 45 gün, diğeri 37 dakika yaşar; mutlak saatler çoğunlukla hangi veri setinde olduğunu ele verir. Bunun yerine hedef bir yakıt göstergesi: kalan faydalı ömür (RUL), toplam ömrün oranı olarak, 1 → 0. Ayrıca her öznitelik o rulmanın kendi sağlıklı taban çizgisine bölünüyor; böylece 2,0 her makinede "sağlıklı uğultusunun iki katı" demek. Üç veri seti tek ortak tabloda buluşuyor; ileride dördüncü bir düzenek tak-çalıştır bir yükleyici.

Adım 2 · Fizik öznitelikleriGeometriden zarf spektrumu

Kusur davul çalar. Bilye çatlağın üzerinden her geçtiğinde küçük bir darbe üretir ve bu davulun temposu (BPFO, BPFI, BSF) doğrudan teknik resimden hesaplanır — dış bilezik, iç bilezik ve makara hasarının hangi ritmi tutturacağını geometri söyler. Zarf spektrumu öznitelikleri tam da bu ritimleri dinler. Geometriden geldikleri, herhangi bir düzeneğe ait olmadıkları için taşınma ihtimali en yüksek öznitelikler bunlar — ve güvenilmeden önce bilinen bir arızada kanıtlandılar.

Adım 3 · Dürüst etiketlerYalnızca başlangıçtan sonra eğit

Sağlıklı bir rulmanın uğultusu ne zaman arızalanacağı hakkında hiçbir şey söylemez — arızaya yol açacak çatlak henüz ortada yok. Bu yüzden model bir falcı değil, onkolog: Bölüm 1'in 6σ alarmı (titreşimin rulmanın kendi sağlıklı bandından çıkması) dosyanın ne zaman açılacağına karar veriyor; rastgele orman yalnızca bu başlangıçtan sonra eğitiliyor ve tahmin ediyor.

Adım 4 · SınavLOBO vs LODO

İki sınav. Bir-rulmanı-dışarıda-bırak (LOBO): model bu düzeneğin kardeşlerini görmüş, yalnızca bu rulmanı görmemiş — tanıdık bir modelin yeni bir arabasına teşhis koymak gibi. Bir-veri-setini-dışarıda-bırak (LODO): düzeneğin tamamı bir yabancının arabası. İki notun farkı genelleme açığı — bu çalışmanın ölçmek için var olduğu sayı.

Sonuçlar

Açık küçük. Nedenleri ilginç.

Bu çalışmanın ortaya koyduğu altı şey, baştan ve açıkça. Her biri aşağıda anlatılan düzeltmelerden sağ çıktı; iki bulgu revize edildi ve burada alıntılanan, revize edilmiş olanı.

Önce fizik özniteliğinin çalıştığını kanıtla

Envelope spectrum of IMS test 2 bearing 1 near failure showing sharp peaks at exactly BPFO ×1, ×2, ×3, and the BPFO band energy trend rising 21.7× over the test

Bir birim testi, ama fizik için. IMS test 2 rulman 1, belgelenmiş bir dış bilezik kusuruyla arızalandı; öyleyse zarf spektrumu hesaplanan dış bilezik temposunda (BPFO, 236 Hz) ve harmoniklerinde davul çalmalı — ve çalıyor, hem de keskin biçimde; iç bilezik ve makara ritimleri sessiz kalıyor. Davulun enerjisi test boyunca 21,7 kat büyüyor. Zarf öznitelikleri modele ancak bu kontrolden sonra girdi.

Ana sonuç: rulman görülmemiş vs düzeneğin tamamı görülmemiş

Bar chart comparing LOBO and LODO median life-fraction error per dataset; FEMTO is hardest in both, IMS shows only a modest gap

Ana sonuç: düzeneğin tamamını saklamak medyan hatayı neredeyse kımıldatmıyor (0,188 → 0,169). İki sürpriz. Beklediğimiz makaralı-bilyeli duvarı hiç çıkmadı — yalnızca bilyeli rulmanlarla eğitilen modeller makaralı düzeneği gayet idare etti (0,168). Ve iki yönde de en zor veri seti FEMTO; sebebi sıradan: kesitleri 0,1 saniye sürüyor, yani her teşhis parmak şıklatması kadar bir sesten konuyor. Baskın zorluk olarak kayıt kalitesi, rulman tipi fiziğini yendi.

ProtokolMedyan hataGeç evre (Q4)En kötü rulman
LOBO — rulman görülmemiş0.1880.1210.347
LODO — IMS (makaralı) dışarıda0.1680.1600.212
LODO — XJTU dışarıda0.1060.0540.370
LODO — FEMTO dışarıda0.2490.3180.434

Buradaki iki satır bilerek aynı ön işlemeyi paylaşıyor. Yardım almış bir modeli almamış bir modelle kıyaslamak genellemeyi değil, o yardımı ölçerdi; bu yüzden açık eşit koşullarda veriliyor. O yardım var ve FEMTO satırını hatırı sayılır biçimde iyileştiriyor: geç evre hatası 0,318 → 0,153. Bu tablodan dışarıda tutulup, sayfanın FEMTO'nun neden en zor olduğuna dair ilk verdiği ve yalnızca yarısı doğru çıkan açıklamayla birlikte aşağıdaki Düzeltme ve inceleme bölümünde ele alınıyor.

En iyi, medyan — ve bilerek gösterilen en kötü

Three predicted-versus-true life fraction trajectories with 5th to 95th percentile uncertainty bands: an accurate best case, a noisy FEMTO median case, and a failed worst case where the model calls the bearing nearly dead from onset

Tahmin vs gerçek ömür oranı; gölgeli bant, ormanın 300 ağacının %90'ının nereye düştüğünü gösteriyor. Gördüklerini iki şey açıklıyor. Birincisi, modelin hafızası yok — her kesit taze bir teşhis alıyor; aralarda hafızası silinen, tek bir kan tahlilinden çalışan bir doktor gibi. Titreme bundan. İkincisi, ömrün ortası gerçekten belirsizdir ("biraz hasta", ömrün %30'unda da %50'sinde de %70'inde de aynı görünür); sonu ise şaşmaz — bu yüzden bant ortada geniş, sonda kapanıyor. En iyi durum kısmen kolay bir sınav: alarmı ömrün %93'ünde çaldı, geriye izlenecek yalnızca son, apaçık bölüm kaldı. En kötü durum ise dürüst olan ve tehlikeli yönde hata yapıyor: alarm geç, ömrün %88'inde çalıyor ve model, geriye ancak onda biri kalmışken rulmanı ömrünün %40–70'i duruyormuş gibi okuyor. Gerçeğe ancak son dakikalarda oturuyor. Canını yakan, iyimser kaçırmadır — kötümser bir model sizi sağlam bir rulmanı boşuna kontrol etmeye yollar, bu model ise çalışmaya devam edin derdi. Yine de fazla anlam yüklememeli: ikinci en kötü rulman tam tersi yönde hata yapıyor; ömrünün büyük kısmı dururken sıfıra yapışık gidiyor ve ikisi arasında 0,004 var. Modelin sistematik bir hata yönü yok — iki türlü şaşırma biçimi var ve hangisinin tabloda başa güreçeceği neredeyse yazı tura. Medyanlar böyle rulmanları saklar; bu rapor saklamıyor.

Eğri ekstrapolasyonu yalnızca kolay sorulara cevap veriyor

Error versus post-onset life stage for the random forest, exponential extrapolation, and a fusion; forest error is U-shaped, extrapolation appears flat but only answers on a minority of snapshots

Literatür, eğri ekstrapolasyonunun erken dönemde çuvallayıp geç dönemde parladığını söyler; yani popülasyon modeli erken kazanmalı, sonra bayrağı devretmeli. Verimiz bu temiz hikâyeyi reddetti — çünkü ekstrapolatör yalnızca emin olduğu sorulara cevap veren bir öğrenci: sadece hasar gerçekten üstel büyürken tahmin üretiyor (erken kesitlerin %17–33'ü), dolayısıyla gösterişli erken notu kendi seçtiği kolay bir alt kümede veriliyor. Orman her soruya cevap veriyor; hatası U şeklinde (en kötüsü başlangıçtan hemen sonra). 36 ömürle, kesişme ilan etmek yerine eğrileri ve kapsama oranını raporluyoruz.

Sızıntı kontrolü: veri seti kimliği toplam önemin %0,3'ü

Top 20 feature importances led by smoothed RMS and kurtosis with envelope band features spread throughout; absolute-time rate features carry 0.3 percent

Kopya kontrolü. Burada zeki görünmenin en kolay yolu, kesitin hangi veri setinden geldiğini tanımak — sınav kâğıtlarını el yazısından tanıyarak notlamak gibi — ve en bariz parmak izi, düzenekler arasında 100 kat farklı olan duvar-saati bozulma hızı. O hız öznitelikleri toplam önemin %0,3'ünü taşıyor: orman yumuşatılmış RMS'e (%27), yumuşatılmış basıklığa ve geometriden türetilen zarf bantlarının geniş bir yelpazesine yaslanıyor. Veri seti kimliği değil, hasar sinyali. İki ablasyon denetimi tamamlıyor: makaralı rulman verisini çıkarmak bilyeli tahminleri kötüleştiriyor (0,190 → 0,200 — aykırı düzenek aslında yardım ediyormuş) ve kafes arızalı rulmanları dışlamak hiçbir şeyi değiştirmiyor (0,190'lık temele karşı 0,188).

Düzeltme ve inceleme

İkinci bir bakış en zor düzeneğin geç dönem hatasını yarıya indirdi — ve nedenine dair açıklamamı çürüttü.

Yukarıdaki sonuçlar yayımlandıktan sonra yeniden incelendi. İki şey çıktı. FEMTO rulmanının ölçüleriyle ilgili bir çekince kapandı ve zararsız olduğu görüldü. Bir de bu sayfanın FEMTO'yu en zor düzenek yapan şey için verdiği açıklama — "kayıtları çok kısa" — yalnızca yarı doğruydu ve bu yarım doğru, düzeltilebilir bir kusuru gizliyordu. İkisi de yukarıdaki tablolara sessizce işlenmek yerine burada kayda geçiriliyor; çünkü bir sayının nasıl kımıldadığı, çoğu zaman nereye oturduğundan daha öğreticidir.

TanımÖmür-oranı hatası

Model saat tahmin etmiyor; rulmanın toplam ömrünün ne kadarlık bir oranının önünde durduğunu tahmin ediyor. 0,318'lik bir hata, tahminin o rulmanın tüm ömrünün yaklaşık üçte biri kadar şaştığı anlamına gelir — üç saat yaşayan bir rulmanda kabaca bir saat. Küçük olması iyidir; 0 kusursuz olurdu.

TanımGeç evre (Q4)

Rulmanın çöküşünün son çeyreği — hasarın fark edildiği andan arızalandığı ana kadarki sürecin son bölümü. Asıl önemli sayı budur; çünkü rulman hâlâ neredeyse sağlıklıyken yapılan tahmin her yöntem için tahminden ibarettir, oysa arızadan kısa süre önce yapılan tahmin gerçekten bakım planlayacağınız şeydir.

TanımEğitim verisi

Modelin öğrendiği çözülmüş örnekler: cevapları yanına iliştirilmiş, çoktan ölmüş başka rulmanlar. Bir asistanın hasta görmeden önce çalıştığı ders kitabı vakaları gibi düşünün.

TanımTest verisi

Değerlendirilen rulmandan gelen ölçümler — eğitimden tamamen dışarıda tutulmuş bir düzeneğe ait, yani modelin ne kendisini ne de kardeşlerini gördüğü bir rulman. Ders kitabı değil, hastanın kendisi.

Güvenerek aldığımız ölçü — kontrol edildi, zararsız çıktı

Bu çalışmanın dinlediği arıza ritimleri rulmanın iç ölçülerinden hesaplanıyor; dolayısıyla yanlış bir ölçü, yanlış frekansı dinlemek demek. FEMTO'nun NSK 6804 değeri üreticiden değil, ikincil literatürden gelmişti. Gerçek veri sayfasını çekmek meseleyi kapattı: 13 bilya ve 3,5 mm bilya çapı doğruymuş, ama bilya merkezleri varsayılan 25,6 mm'lik değil, 26,0 mm'lik bir daire üzerinde duruyor.

BüyüklükYayımlananVeri sayfasıSonucu
Bilya merkez daire çapı25.6 mm26.0 mmvarsayım → doğrulandı
Bilya dönme frekansı%1,6 düşükdüzeltildi27 banttan 6'sı bir adım kayıyor
Bu sayfadaki her sonuçdeğişmedi

Tüm FEMTO veri setini ham sinyalden yeniden hesaplamak yalnızca bilya dönme özniteliklerini oynattı, IMS ve XJTU'yu bit düzeyinde aynı bıraktı ve hiçbir sonucu değiştirmedi. Bu sıkıcı bir sonuç ve yine de yayımlanmayı hak ediyor: "kontrol ettik, fark etmedi" ile "hiç kontrol etmedik" aynı cümle değil.

Yanlış nedeni kovalamak — ve doğrusunu bulunca gelen yarılanma

Two bar charts. Left: late-stage error per held-out rig, as published versus after correction — FEMTO falls from 0.318 to 0.153 while IMS and XJTU rise slightly. Right: FEMTO late-stage error under four conditions — steadying neither 0.318, test rows only 0.332, training rows only 0.095, both 0.094.

Bu sayfa FEMTO'nun zorluğunu parmak şıklatması kadar süren kayıtlarına bağlamıştı. Bundan çıkan bariz çare şu: gelen ölçümleri değerlendirmeden önce sabitle — her birine tepki vermek yerine son beşinin ortancasını al. Bu doğrudan test edildi; aynı işlem bir de ders kitabı vakalarına uygulandı. Sonuç sezgiyi tersine çeviriyor.

Neye sabitleme uygulandıGeç evre hatasıHüküm
Hiçbir şeye — ilk yayımlandığı hali0.318temel
Gelen FEMTO ölçümlerine0.332biraz daha kötü
Eğitim örneklerine0.095%70 daha iyi
İkisine birden0.094tek başına eğitimden iyi değil

Hastanın dosyasını temizlemek hiçbir işe yaramıyor. Ders kitabını temizlemek neredeyse her şeyi düzeltiyor. Mekanizma şu: çözülmüş örnekler zıplıyorsa model asıl çöküşü değil, o zıplamayı öğreniyor — o düzeneklere özgü ölçüm saçılmasına uyum sağlıyor. Örnekleri sabitleyin, arızanın gerçek şeklini öğreniyor; öğrendikten sonra da yeni ve gürültülü bir sinyali hiçbir temizlik olmadan gayet iyi okuyor. Birine bulanık ders kitabı fotoğraflarıyla eğitim verirseniz bulanıklığı öğrenir; sonradan hastanın röntgenini netleştirmek bunu geri almaz.

En çok FEMTO'yu vurmasının gösterişsiz bir sebebi var. FEMTO'yu dışarıda bırakmak, öğrenilecek en küçük örnek yığınını geriye bırakıyor — 4.610 satır; diğer iki dönüşümde 14.220 ve 15.536. Örneğin az olduğu durum, tam da modelin gürültüyü ezberlediği durumdur; dolayısıyla örnekleri temizlemek en çok orada işe yarıyor. Bu, gürültü giderme değil düzenlileştirme — ve şu anlama geliyor: ilk teşhis olan "FEMTO zor, çünkü kayıtları kötü" bir belirtiyi tarif ediyormuş. Kayıtlar gerçekten daha kötü. Ama cezanın büyük kısmı mikrofondan değil, modelden geliyormuş.

Bir itiraf daha; çünkü bu, özete hangi sayının gireceğini değiştiriyor. O 0,095, her seçeneğin dışarıda bırakılan düzeneğe karşı nasıl not aldığını gördükten sonra seçilen bir sabitleme miktarıyla elde edildi — yani gizlice bakarak. Bu, tartıyı birazdan tartacağınız cismin kendisiyle kalibre etmenin okumayı güzelleştirmesi gibi sonucu güzelleştirir. Kurallara uygun biçimde yeniden yapıldığında — miktar yalnızca modelin eğitildiği düzeneklere bakılarak seçilip, dışarıdaki düzeneğe en sonda bir kez dokunulduğunda — geç evre hatası 0,153'e oturuyor. 0,318'e karşı yine %52'lik bir azalma ve alıntılanmayı hak eden sayı bu. 0,153 ile 0,095 arasındaki farkın da söylenmeye değer bir sebebi var: ayar, görebildiğiniz düzeneklerden seçilmek zorunda ve onlar da tam olarak bu ayara ihtiyacı olmayanlar. Hiç tanışmadığınız bir makine için gürültü ayarı yapamazsınız.

Neyi iyileştirdi

Three panels of FEMTO bearings judged by a model that never saw their rig. A grey dashed line taught from jittery examples sits near 0.6 across the middle and right panels while true life falls to zero; a blue line taught from steadied examples tracks the truth far more closely.

Aynı düzeltme, gerçekten işlediği yerde gösteriliyor. Buradaki her eğri, düzeneğini hiç görmemiş bir model tarafından değerlendirilen bir FEMTO rulmanı. Test sinyali iki çizgide de aynı — ham, dokunulmamış — dolayısıyla aralarındaki tek fark, modelin neyden öğrendiği. Gri, zıplayan örneklerden öğrendi; mavi, sabitlenmiş örneklerden. Ortadaki ve sağdaki panellerde gri çizgiye bakın: 0,6 civarına park edip orada kalıyor; altında rulman ölürken sakin sakin ömrün büyük kısmının durduğunu bildiriyor. Mavi ise gerçeği aşağı doğru takip ediyor. On yedi FEMTO rulmanının tamamında medyan hata 0,249 → 0,214 düşüyor, geç evre hatası yarıya iniyor: 0,318 → 0,153; tek başına en çok kazanan 0,409 → 0,107.

Sağdaki panel bilerek orada; çünkü medyan çok şey saklar: 17 rulmanın 7'si kötüleşti, biri fena halde (0,103 → 0,307). Gösterilen en kötü durum, kötüleşenlerden biri — 0,266 → 0,338 — ve ona ne olduğu görülüyor: mavi artık tüm koşu boyunca sıfıra yapışıyor, yani rulmanı daha baştan ölmüş sayıyor. Dolayısıyla dürüst tarif şu değil: “model iyileşti”; şu: “model bir hatayı başka bir hatayla takas etti”. Eskiden balıklama iyimserdi; şimdi zaman zaman fazla kötümser. Gerçekten aksiyon alacağınız bir makinede bu, bariz biçimde daha küçük bir hata değil, farklı bir hatadır. Medyan iyileşti, hataların karakteri değişti ve özete ikisi de girmeli.

Ne düzelmedi

Six trajectory panels in two rows: best, median and worst bearing as published on top, after correction below. Best and median are the same bearing in both rows with visually identical curves; only the worst slot changes hands.

Hiçbir şeyi değiştirmemiş bir düzeltmenin en net resmi. En iyi ve medyan, iki satırda da aynı rulman ve eğrileri birbirinden ayırt edemiyorsunuz — ki bu tam da olması gereken: bunlar rulman-görülmemiş eğrileri ve o protokol bilerek yumuşatılmadan bırakılıyor. Yalnızca en kötü slotu el değiştiriyor, o da iki rulman dört binde bir fark ile sıra değiştirdiği için. FEMTO'nun geç evre hatasını yarıya indiren düzeltme, düzeneğin-tamamı-görülmemiş protokolünde yaşıyor ve burada görünmüyor; onu yukarıdaki grafikte görüyorsunuz.

Tüm bunlardan etkilenmeyen dört şey var ve aksini ima etmek bu işin amacını ortadan kaldırırdı. Aynı düzenekten kardeş bir rulman varken örnekleri sabitlemek hiçbir şey yapmıyor — doğrudan test edildiğinde rulman-görülmemiş sınavı 0,002 kadar oynadı, yani değişmedi; fayda yalnızca düzeneğin tamamı yabancıyken ortaya çıkıyor, ki asıl önemli durum da o. IMS az da olsa kötüleşti (0,160 → 0,187). FEMTO'nun frekans çözünürlüğü kalıcı: 0,1 saniyelik bir kaydın hiç yakalamadığı ayrıntıyı hiçbir işlem geri getirmez. Ve "arıza zamanı" hâlâ seçilmiş bir tanım, FEMTO'nun arıza tipleri hâlâ belgesiz, 36 ömür hâlâ küçük bir sayı. Dürüst özet şu: büyük hatalardan biri kabaca üçte iki oranında azaldı, bu sayfadaki diğer her şey olduğu gibi duruyor.

Dürüst sınırlar

Sayıları alıntılamadan önce bunları oku.

Sırada ne var

4. veri seti kendi düzeneğim olacak.

Boru hattı, yeni bir veri seti tak-çalıştır bir yükleyici olsun diye kuruldu. Plan: SKF 6204 rulmanı etrafında masaüstü bir düzenek, hızlandırılmış yük altında doğal arızaya kadar çalıştırılacak. Ekilmiş kusurlardan vazgeçildi — eğeyle veya erozyonla açılan çentik imal edilmiş bir şekildir; gerçek çukurlaşma ise yüzeyin altındaki yorulma çatlağından büyür, dolayısıyla kusur ekilmiş bir rulman daha ilk turunda hasarlıdır. Bu da onu ayrılacak sağlıklı bir taban çizgisinden yoksun bırakır — oysa bu boru hattının tamamı, rulmanın kendi sağlıklı halinden ayrılmasını ölçmek üzerine kurulu. Ekilmiş kusurlar hâlâ teşhis yarısını kanıtlayabilir (dış bilezik davulu, geometrinin söylediği yerde beliriyor mu?), ama kalan ömür verisi ancak sağlıklı bir rulmanın gerçekten ölüşünü izlemekten çıkar.

Kayıt şartnamesi doğrudan FEMTO incelemesinin bulgusundan geliyor: 20 kHz ve üzeri örnekleme ile 1–2 saniyelik kesitler — gürültüyü azaltmak için değil (o, yazılımda çözülebilir çıktı), frekans çözünürlüğü için; o çözülemiyor. Her koşunun başında sabit süreli bir sağlıklı taban kaydı alınıp işaretlenecek ve durdurma kriteri düzenek çalıştırılmadan önce yazılacak; böylece bu, dört veri seti içinde arıza zamanı bir yorum değil bir ölçüm olan tek set olacak. Önemli olan iddiayı sınamak için üç-dört doğal arıza yeter: diğer üç düzenekte eğitilmiş bir model, hiç görmediği bir düzenekteki rulmanın evresini belirleyebiliyor mu?