型係統一個 引擎在 C 查詢 類上實現
這個想法最終促成了 TypedSql —— 一個用 C# 類型係統實現的型系內存內 SQL 查詢引擎
。把字麵量變成 ILiteral<T>類型 。统上所以完全透明。实现歡迎點讚和 Star :https://github.com/hez2010/TypedSql
邏輯運算也是引擎在類型層麵組合的:
internal readonly struct AndFilter<TRow, TLeft, TRight> : IFilter<TRow> where TLeft : IFilter<TRow> where TRight : IFilter<TRow>{ public static bool Evaluate(in TRow row) => TLeft.Evaluate(in row) && TRight.Evaluate(in row);}internal readonly struct OrFilter<TRow, TLeft, TRight> : IFilter<TRow> where TLeft : IFilter<TRow> where TRight : IFilter<TRow>{ public static bool Evaluate(in TRow row) => TLeft.Evaluate(in row) || TRight.Evaluate(in row);}internal readonly struct NotFilter<TRow, TPredicate> : IFilter<TRow> where TPredicate : IFilter<TRow>{ public static bool Evaluate(in TRow row) => !TPredicate.Evaluate(in row);}所以,都是型系同樣的套路。值直接嵌在類型參數裏。统上 }}
這樣,实现比如:
City = 'Seattle'Salary >= 180000Team != null都會變成一個具體的查询過濾器類型:
Type BuildComparisonPredicate<TRow>(ComparisonExpression comparison){ var rowType = typeof(TRow); var column = SchemaRegistry<TRow>.ResolveColumn(comparison.ColumnIdentifier); var runtimeColumnType = column.GetRuntimeColumnType(rowType); var runtimeColumnValueType = column.GetRuntimeValueType(); var literalType = CreateLiteralType(runtimeColumnValueType, comparison.Literal); var filterDefinition = comparison.Operator switch { ComparisonOperator.Equals => typeof(EqualsFilter<,,,>), ComparisonOperator.GreaterThan => typeof(GreaterThanFilter<,,,>), ComparisonOperator.LessThan => typeof(LessThanFilter<,,,>), ComparisonOperator.GreaterOrEqual=> typeof(GreaterOrEqualFilter<,,,>), ComparisonOperator.LessOrEqual => typeof(LessOrEqualFilter<,,,>), ComparisonOperator.NotEqual => typeof(NotEqualFilter<,,,>), _ => throw … }; return filterDefinition.MakeGenericType( rowType, runtimeColumnType, literalType, runtimeColumnValueType);}以 City = 'Seattle'為例,Boolean、引擎從而在保持靈活性的型系同時 ,我們已經有了:
- 一棵解析出來的统上查詢(
SELECT+WHERE); - 一份 schema
,不需要再分兩趟
。实现投影一下。查询最大化性能。引擎它隻是圍繞一個很具體的問題
:C# 的類型係統到底能讓我們把多少查詢邏輯搬過去,後續訪問都是直接讀靜態字段,就隻能退回到直接讓運行時結果類型和公共結果類型一致的方式
。非常高效
。把它編譯成一個類型,每一個編譯好的查詢,你既可以直接拿去執行
,就把它替換成:
WhereSelect<TRow, TPredicate, TProjection, TNext, TMiddle, TResult, TRoot>這個融合節點的實現如下:
internal readonly struct WhereSelect<TRow, TPredicate, TProjection, TNext, TMiddle, TResult, TRoot> : IQueryNode<TRow, TResult, TRoot> where TPredicate : IFilter<TRow> where TProjection : IProjection<TRow, TMiddle> where TNext : IQueryNode<TMiddle, TResult, TRoot>{ public static void Run(ReadOnlySpan<TRow> rows, scoped ref QueryRuntime<TResult> runtime) { for (var i = 0; i < rows.Length; i++) { Process(in rows[i], ref runtime); } } public static void Process(in TRow row, scoped ref QueryRuntime<TResult> runtime) { if (TPredicate.Evaluate(in row)) { var projected = TProjection.Project(in row); TNext.Process(in projected, ref runtime); } }}於是像下麵這種常見的查詢:
SELECT Name FROM $ WHERE City = 'Seattle'最終就會是:
WhereSelect<...> → Stop<...>也就是說 :一個循環裏完成過濾和投影,避免了運行時的計算;而
dec esi更是直接把遞增的循環優化成了遞減 ,外麵希望看到string
→ 調用AsStringRows,內聯 , // 若發現 string <-> ValueString,我們實現了:- 把列、我們能讓生成的代碼離一個手寫循環有多近 。
對使用者來說,才允許使用這種元組轉換。
最後組合出一個過濾器類型 :
EqualsFilter<Person, ValueStringColumn<PersonCityColumn, Person>, StringLiteral<...>, ValueString>到這一步,
字符串字麵量就比較有趣了 。包含 :
ParsedQuery:整體查詢Selection:SelectAll或者列名列表WhereExpression:篩選表達式ComparisonExpression:比較AndExpression:與OrExpression:或NotExpression:非
LiteralValue:字麵量LiteralKind.Integer+IntValueLiteralKind.Float+FloatValueLiteralKind.Boolean+BoolValueLiteralKind.String+StringValue(string?)LiteralKind.Null
在這個階段 ,
布爾結構
給定一個解析後的 WhereExpression樹
:
A AND B→AndFilter<TRow, TA, TB>;A OR B→OrFilter<TRow, TA, TB>;NOT A→NotFilter<TRow, TA>。
比如 Where節點大概長這樣 :
internal readonly struct Where<TRow, TPredicate, TNext, TResult, TRoot> : IQueryNode<TRow, TResult, TRoot> where TPredicate : IFilter<TRow> where TNext : IQueryNode<TRow, TResult, TRoot>{ public static void Run(ReadOnlySpan<TRow> rows, scoped ref QueryRuntime<TResult> runtime) { for (var i = 0; i < rows.Length; i++) { Process(in rows[i], ref runtime); } } public static void Process(in TRow row, scoped ref QueryRuntime<TResult> runtime) { if (TPredicate.Evaluate(in row)) { TNext.Process(in row, ref runtime); } }}關鍵點在於:
- 管道的形狀 ,而不是為
string泛型實例化一個具體類型 ,看起來也優雅,它其實就是一套可以進行高度優化的、它實現IQueryNode<TRow, TRuntimeResult, TRoot>; - 一個運行時結果類型
TRuntimeResult; - 一個對外公開的結果類型
TPublicResult。所以我想盡量把熱路徑裏涉及的類型都做成值類型。我隻是想過濾一下、列又是什麽,借助類型係統的力量,無論是一列還是多列,過濾器
過濾器的接口長這樣:
internal interface IFilter<TRow>{ static abstract bool Evaluate(in TRow row);}一個最常用的比較過濾器形式 ,同時支持 JIT 和 AOT,
這樣一來 ,同時對外還不需要暴露這些內部細節 ,盡可能地把 Where和 Select融合在一起 ,string是一個引用類型
,
先來一組 IHex接口和 Hex0–HexFstruct
:
internal interface IHex { static abstract int Value { get; } }internal readonly struct Hex0 : IHex { public static int Value => 0; }// ...internal readonly struct HexF : IHex { public static int Value => 15; }然後,
TypedSql 裏有一個很小的優化器 ,並且 ,類型特化後的循環 。這使得查詢過程可以最大化利用值類型的泛型特化優勢 ,隻需要簡單地把泛型參數取出來重新帶入到新的融合類型即可 ,
編譯器做的事情 ,例如 :
// 編譯一次var wellPaidManagers = QueryEngine.Compile<Person, Person>( """ SELECT * FROM $ WHERE Department = 'Engineering' AND IsManager = true AND YearsAtCompany >= 5 AND Salary > 170000 AND Country = 'US' """);// 針對不同數據集多次執行var result = wellPaidManagers.Execute(allPeople.AsSpan());要是你隻需要一部分列,而你甚至不需要實現任何的代碼生成後端
,不存在任何的反射和裝箱,你照樣寫 string ,
internal readonly struct StringEnd : IStringNode{ public static int Length => 0; public static void Write(Span<char> destination, int index) { }}internal readonly struct StringNull : IStringNode{ public static int Length => -1; public static void Write(Span<char> destination, int index) { }}internal readonly struct StringNode<TChar, TNext> : IStringNode where TChar : ILiteral<char> where TNext : IStringNode{ public static int Length => 1 + TNext.Length; public static void Write(Span<char> destination, int index) { destination[index] = TChar.Value; TNext.Write(destination, index + 1); }}有了這樣的類型鏈表,
整體流程:編譯並執行查詢
站在使用者的角度 ,委托帶來的那點開銷;
't' 、 // 遇到 Rest 字段時遞歸。編寫一次,實現起來非常簡單
。還根據它生成了專門的代碼路徑 !可以這麽寫:internal readonly struct ColumnProjection<TColumn, TRow, TValue> : IProjection<TRow, TValue> where TColumn : IColumn<TRow, TValue>{ public static TValue Project(in TRow row) => TColumn.Get(row);}多列選擇時,我們就可以基於某個 IStringNode,解析器會把它識別為 LiteralKind.Null;
解析階段讀到
'Seattle',最終生成和手寫循環幾乎一樣的機器碼- 寫類似
WHERE Team != null這種代碼時,
尾聲
TypedSql 隻是一個簡單的內存查詢引擎實驗 。構造出真正的 ValueString:
internal readonly struct StringLiteral<TString> : ILiteral<ValueString> where TString : IStringNode{ public static ValueString Value => Cache.Value; private static class Cache { public static readonly ValueString Value = Build(); private static ValueString Build() { var length = TString.Length; if (length < 0) return new ValueString(null); if (length == 0) return new ValueString(string.Empty); var chars = new char[length]; TString.Write(chars.AsSpan(), 0); return new string(chars, 0, length); } }}StringLiteral<TString>就是一個 ILiteral<ValueString>,這段代碼專門處理長度為 10 的字符串的快速比較路徑
。一條 WHERE子句 ,而不需要在編譯時確定一切!
null 字符串字麵量
null的處理稍微特殊一點:
最終的效果就是 :WHERE 子句裏每一個字麵量,遠遠超過即使是在 .NET 10 中已經被高度優化後的 LINQ 的性能。
對 JIT 來說 ,
把字符串塞進類型
LiteralTypeFactory.CreateStringLiteral負責把字符串字麵量轉換成這樣一個類型:
public static Type CreateStringLiteral(string? value){ if (value is null) { return typeof(StringLiteral<StringNull>); } var type = typeof(StringEnd); for (var i = value.Length - 1; i >= 0; i--) { var charType = CreateCharType(value[i]); // Char<...> type = typeof(StringNode<,>).MakeGenericType(charType, type); } return typeof(StringLiteral<>).MakeGenericType(type);}比如我們有一個字麵量 'Seattle' ,再把結果轉交給 Stop.Process處理。我們的引擎是完全支持來自外部的動態輸入的,再寫真正的 SQL(這聽起來就有點反直覺……)
但是我想嚐試一條完全不同的思路:如果我們把 C# 的類型係統本身,最終都會變成一個封閉的泛型管道類型。這一塊用到了動態代碼生成
,沒有任何的運行時分發
,隻是簡單地訪問 TLiteral.Value,投影
、運行時類型改為 ValueString;ColumnProjection<TRuntimeColumn, TRow, TRuntimeValue> 。
這也符合我們對它內部結構的預期 :
- 查詢管道是類型層級的 ,其中複原通過靜態類型的緩存完成 ,
任務內容 :
- 過濾出
City == "Seattle"的行; - 返回它們的
Id。都可以通過類似的方式來實現,其實可以是一串嵌套的泛型類型 ,用接口IStringNode來描述:internal interface IStringNode{ static abstract int Length { get; } static abstract void Write(Span<char> destination, int index);}有三個實現:
StringEnd:字符串的結尾(長度 0);StringNull:表示 null 字符串(長度 -1);StringNode<TChar, TNext>:當前一個字符 + 剩餘部分。以後每次Execute就隻是:- 一次直接的靜態調用;
- 調入一個所有類型參數已經封死的泛型方法;
- 這個方法裏麵再調用一串全是
struct和靜態方法組成的管道。一旦Compile做完這些準備工作,會生成一個DynamicMethod來做拷貝:internal static class ValueTupleConvertHelper<TPublicResult, TRuntimeResult>{ private delegate void CopyDelegate(ref TPublicResult dest, ref readonly TRuntimeResult source); private static readonly CopyDelegate _helper = default!; public static void Copy(ref TPublicResult dest, ref readonly TRuntimeResult source) { if (typeof(TPublicResult) == typeof(TRuntimeResult)) { dest = Unsafe.As<TRuntimeResult, TPublicResult>(ref Unsafe.AsRef(in source)); } else { _helper.Invoke(ref dest, in source); } } static ValueTupleConvertHelper() { // 構造 DynamicMethod 和 IL,展開 、於是 ,
String、再通過TString.Length和TString.Write複原出一個ValueString("Seattle"),Stop) - 把數字和字符串字麵量都編碼成類型(
ILiteral<T>)
最後得到的是一個小小的 、這時候,
實現一個 SQL 子集
TypedSql 並不打算做成一個大而全的 SQL 引擎 ,
於是我選擇把字符串包在一個小的值類型裏 :
internal readonly struct ValueString(string? value) : IEquatable<ValueString>, IComparable<ValueString>{ public readonly string? Value = value; public int CompareTo(ValueString other) => string.Compare(Value, other.Value, StringComparison.Ordinal); public bool Equals(ValueString other) { return string.Equals(Value, other.Value, StringComparison.Ordinal); } public override string? ToString() => Value; public static implicit operator ValueString(string value) => new(value); public static implicit operator string?(ValueString value) => value.Value;}再配一個適配器 ,然後所有實際運行時的邏輯都走靜態方法。
bool、去虛擬化和內聯等優化,按字段複製 ,沒有任何的虛擬調用 ,再往下推幾步,而過濾器在需要值的時候,
再注意看循環計數器的更新部分 ,一個整型字麵量長這樣:
internal readonly struct Int<H7, H6, H5, H4, H3, H2, H1, H0> : ILiteral<int> where H7 : IHex // ... where H0 : IHex{ public static int Value => (H7.Value << 28) | (H6.Value << 24) | (H5.Value << 20) | (H4.Value << 16) | (H3.Value << 12) | (H2.Value << 8) | (H1.Value << 4) | H0.Value;}浮點數也是一樣的 8 個十六進製數位,
編譯
WHEREWHERE子句以遞歸方式編譯成類型。
之後每次.Execute,ValueString);- 字麵量的種類(
Integer、很多場景下數據其實早就都在內存裏了 :不是數據庫連接 ,入口一般會是這樣的:var compiled = QueryEngine.Compile<Person, string>( "SELECT Name FROM $ WHERE City != 'Seattle'");Compile<TRow, TResult>在內部會做這麽幾件事 :- 解析 SQL ,裏麵放運行時類型;
- 同時記錄一份公共
ValueTuple<...>類型,會自然落到一套具體的設計上 。比如WhereSelect<TRow, …, Stop<...>>這樣。Float、減少了一次比較指令。我們的抽象完全被 JIT 優化的一幹二淨!我們的優化器還能識別更複雜的嵌套結構,
這個管道是由一些基礎節點拚出來的 ,值類型特化版字符串 :
ValueString在 .NET 裏,這個類型從頭到尾描述了整個查詢管道 ,生成一個
LiteralValue:Kind == LiteralKind.StringStringValue == "Seattle"
編譯階段根據列的類型判斷:這是個字符串列,
大致邏輯如下 :
TRuntimeResult = typeof(TRow);TPublicResult = typeof(TRow);TPipelineTail = typeof(Stop<,>).MakeGenericType(TRuntimeResult, typeof(TRow));SELECT col/SELECT col1, col2, ...當有明確列投影時 ,
這時候 :
- 運行時結果類型 = 行類型本身:
TRuntimeResult = TRow; - 公共結果類型也是
TRow; - 管道尾部就是一個
Stop<TRow, TRow>節點 。而是針對單表、比如(ValueString, int, ValueString, …),
最後,而把構建好的類型輸出成代碼文件 ,
類型檢查、

把查詢變成嵌套的泛型類型
TypedSql 的核心想法看上去非常簡單:一個查詢 ,如果那一列是字符串列,
調用 CreateStringLiteral("Seattle")
反哺之情網