<p>Estimating saturated hydraulic conductivity <InlineEquation ID="IEq1"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="477_2024_2861_Article_IEq1.gif" Format="GIF" Height="19" Rendition="HTML" Resolution="72" Type="Linedraw" Width="24" /> </InlineMediaObject> <EquationSource Format="TEX">\(K_f\)</EquationSource> </InlineEquation> from particle size distributions (PSD) is very common with empirical formulas, while the use of machine learning for that purpose is not yet widely established. We evaluate the predictive power of six machine learning algorithms, including tree-based, regression-based and network-based methods in estimating <InlineEquation ID="IEq2"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="477_2024_2861_Article_IEq2.gif" Format="GIF" Height="19" Rendition="HTML" Resolution="72" Type="Linedraw" Width="24" /> </InlineMediaObject> <EquationSource Format="TEX">\(K_f\)</EquationSource> </InlineEquation> from the PSD solely. We use a dataset of 4600 samples from the shallow Dutch subsurface for training and testing. The extensive dataset provides not only PSD, but also measured conductivities from permeameter tests. Besides training and testing on the entire data set, we apply the six algorithms to data subsets for the soil types sand, silt and clay. We further test different feature/target-variable combinations such as reducing the input to PSD-derived grain diameters <InlineEquation ID="IEq3"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="477_2024_2861_Article_IEq3.gif" Format="GIF" Height="16" Rendition="HTML" Resolution="72" Type="Linedraw" Width="22" /> </InlineMediaObject> <EquationSource Format="TEX">\(d_{10}\)</EquationSource> </InlineEquation>, <InlineEquation ID="IEq4"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="477_2024_2861_Article_IEq4.gif" Format="GIF" Height="16" Rendition="HTML" Resolution="72" Type="Linedraw" Width="22" /> </InlineMediaObject> <EquationSource Format="TEX">\(d_{50}\)</EquationSource> </InlineEquation> and <InlineEquation ID="IEq5"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="477_2024_2861_Article_IEq5.gif" Format="GIF" Height="16" Rendition="HTML" Resolution="72" Type="Linedraw" Width="22" /> </InlineMediaObject> <EquationSource Format="TEX">\(d_{60}\)</EquationSource> </InlineEquation> or estimating porosity from PSD. We test feature importance and compare results to <InlineEquation ID="IEq6"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="477_2024_2861_Article_IEq6.gif" Format="GIF" Height="19" Rendition="HTML" Resolution="72" Type="Linedraw" Width="24" /> </InlineMediaObject> <EquationSource Format="TEX">\(K_f\)</EquationSource> </InlineEquation> estimates from a selection of empirical formulas. We find that all algorithm can estimate <InlineEquation ID="IEq7"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="477_2024_2861_Article_IEq7.gif" Format="GIF" Height="19" Rendition="HTML" Resolution="72" Type="Linedraw" Width="24" /> </InlineMediaObject> <EquationSource Format="TEX">\(K_f\)</EquationSource> </InlineEquation> from PSD at high accuracy (up to <InlineEquation ID="IEq8"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="477_2024_2861_Article_IEq8.gif" Format="GIF" Height="20" Rendition="HTML" Resolution="72" Type="Linedraw" Width="71" /> </InlineMediaObject> <EquationSource Format="TEX">\(R^2/NSE\)</EquationSource> </InlineEquation> of 0.89 for testing data and 0.98 for the entire data set) and outperform empirical formulas. Particularly, tree-based algorithms are well suited and robust. Reducing information in the feature variables to grain diameters works well for predicting <InlineEquation ID="IEq9"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="477_2024_2861_Article_IEq9.gif" Format="GIF" Height="19" Rendition="HTML" Resolution="72" Type="Linedraw" Width="24" /> </InlineMediaObject> <EquationSource Format="TEX">\(K_f\)</EquationSource> </InlineEquation> of sandy samples, but is less robust for silt and clay rich samples. <InlineEquation ID="IEq10"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="477_2024_2861_Article_IEq10.gif" Format="GIF" Height="16" Rendition="HTML" Resolution="72" Type="Linedraw" Width="22" /> </InlineMediaObject> <EquationSource Format="TEX">\(d_{10}\)</EquationSource> </InlineEquation> also shows to be the most influential feature here. An interesting, but not surprising outcome is that PSD is not a suitable predictor for porosity. Overall, our results confirm that machine learning algorithms are a powerful tool for determining <InlineEquation ID="IEq11"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="477_2024_2861_Article_IEq11.gif" Format="GIF" Height="19" Rendition="HTML" Resolution="72" Type="Linedraw" Width="24" /> </InlineMediaObject> <EquationSource Format="TEX">\(K_f\)</EquationSource> </InlineEquation> from PSD. This is promising for applications to e.g. deep-drilling data sets or low-effort and robust <InlineEquation ID="IEq12"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="477_2024_2861_Article_IEq12.gif" Format="GIF" Height="19" Rendition="HTML" Resolution="72" Type="Linedraw" Width="24" /> </InlineMediaObject> <EquationSource Format="TEX">\(K_f\)</EquationSource> </InlineEquation>-estimation of single samples.</p>

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Predicting saturated hydraulic conductivity from particle size distributions using machine learning

  • Valerie de Rijk,
  • Jelle Buma,
  • Hans Veldkamp,
  • Alraune Zech

摘要

Estimating saturated hydraulic conductivity \(K_f\) from particle size distributions (PSD) is very common with empirical formulas, while the use of machine learning for that purpose is not yet widely established. We evaluate the predictive power of six machine learning algorithms, including tree-based, regression-based and network-based methods in estimating \(K_f\) from the PSD solely. We use a dataset of 4600 samples from the shallow Dutch subsurface for training and testing. The extensive dataset provides not only PSD, but also measured conductivities from permeameter tests. Besides training and testing on the entire data set, we apply the six algorithms to data subsets for the soil types sand, silt and clay. We further test different feature/target-variable combinations such as reducing the input to PSD-derived grain diameters \(d_{10}\) , \(d_{50}\) and \(d_{60}\) or estimating porosity from PSD. We test feature importance and compare results to \(K_f\) estimates from a selection of empirical formulas. We find that all algorithm can estimate \(K_f\) from PSD at high accuracy (up to \(R^2/NSE\) of 0.89 for testing data and 0.98 for the entire data set) and outperform empirical formulas. Particularly, tree-based algorithms are well suited and robust. Reducing information in the feature variables to grain diameters works well for predicting \(K_f\) of sandy samples, but is less robust for silt and clay rich samples. \(d_{10}\) also shows to be the most influential feature here. An interesting, but not surprising outcome is that PSD is not a suitable predictor for porosity. Overall, our results confirm that machine learning algorithms are a powerful tool for determining \(K_f\) from PSD. This is promising for applications to e.g. deep-drilling data sets or low-effort and robust \(K_f\) -estimation of single samples.